Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: WeGen – 中科大联合上海交大等推出的统一多模态生成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > WeGen – 中科大联合上海交大等推出的统一多模态生成模型
AIGC 资讯

WeGen – 中科大联合上海交大等推出的统一多模态生成模型

站外新闻
最近更新: 2026年6月8日 下午12:19
SHARE

WeGen是什么

WeGen 是中国科学技术大学联合上海交通大学、微信团队、中国科学院等机构推出的统一多模态生成模型,基于自然对话实现多样化的视觉生成任务。WeGen结合多模态大语言模型(MLLM)和扩散模型,处理文本到图像生成、条件驱动生成、图像编辑、风格迁移等多种任务。WeGen 的核心优势能在用户指令较模糊时提供多样化的创意输出,在用户有具体需求时保持生成结果与指令和参考图像的一致性。WeGen 基于动态实例一致性(DIIC)数据管道和提示自重写(PSR)机制,解决实例身份一致性和生成多样性两大挑战,展现出作为用户友好型设计助手的潜力。

阅读目录
  • WeGen是什么
  • WeGen的主要功能
  • WeGen的技术原理
  • WeGen的项目地址
  • WeGen的应用场景

WeGen

WeGen的主要功能

  • 文本到图像生成:根据文本描述生成高质量的图像。
  • 条件驱动生成:基于特定条件(如边缘图、深度图、姿态图)生成图像。
  • 图像编辑与修复:对现有图像进行修改、修复或扩展。
  • 风格迁移:将一种图像的风格应用到另一张图像上。
  • 多主体生成:在生成图像时保留多个参考对象的关键特征。
  • 交互式生成:基于自然对话与用户交互,逐步优化生成结果。
  • 创意设计辅助:为用户提供多样化的生成选项,激发创意。

WeGen的技术原理

  • 多模态大语言模型(MLLM)与扩散模型结合:基于CLIP作为视觉编码器,将图像转化为语义特征;用扩散模型(如SDXL)作为解码器,生成高质量图像。,LLM(如LLaMA)处理自然语言指令,实现文本与视觉信息的融合。
  • 动态实例一致性(DIIC):用视频序列跟踪对象的自然变化,保持其身份一致性。DIIC数据管道解决传统方法在实例身份保持上的不足,让模型在修改图像时保留关键特征。
  • 提示自重写(PSR)机制:基于语言模型重写文本提示,引入随机性,生成多样化的图像。PSR用离散文本采样,让模型探索不同的解释,保持语义一致性。
  • 统一框架与交互式生成:WeGen将多种视觉生成任务整合到一个框架中,基于自然对话与用户交互,逐步优化生成结果,保留用户满意的部分。
  • 大规模数据集支持:WeGen从互联网视频中提取的大规模数据集进行训练,数据集包含丰富的对象动态和自动标注的描述,帮助模型学习一致性和多样性。

WeGen的项目地址

  • GitHub仓库:https://github.com/hzphzp/WeGen
  • arXiv技术论文:https://arxiv.org/pdf/2503.01115

WeGen的应用场景

  • 创意设计:帮助设计师快速生成创意概念图,激发灵感,适用于广告、包装、建筑等领域。
  • 内容创作:为影视、游戏、动漫等行业生成场景、角色或道具的概念图,加速创作流程。
  • 教育辅助:生成与教学内容相关的图像,帮助学生更直观地理解抽象概念。
  • 个性化定制:根据用户需求生成定制化的设计方案,如服装、家居装饰等。
  • 虚拟社交与娱乐:生成虚拟形象、场景或道具,增强虚拟社交和游戏的体验感。
AI演习变实战?OpenAI新模型意外“入侵”知名开源平台
LongVILA – 面向长视频理解的视觉语言AI模型
WAIC2026 大会火力全开!大模型概念股 MINIMAX 与智谱股价狂飙超 8%
美团开源560亿参数LongCat-Flash-Prover:数学定理证明SOTA,性能全面碾压现有模型
CogAgent-9B – 智谱AI开源 GLM-PC 的基座模型
分享
Email 复制链接 打印
Share
上一篇 子曰翻译2.0 – 网易有道推出的最新翻译大模型
下一篇 MoLing – 本地AI办公自动化助手,基于 MCP 服务器
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

ELLA – 腾讯推出的扩散模型适配器,可增强语义对齐

站外新闻
AIGC 资讯

Devin Desktop – Codeium公司推出的AI开发平台

站外新闻
AIGC 资讯

Pix2Gif – 微软推出的静态图像转动态GIF的扩散模型

站外新闻
AIGC 资讯

Depth Pro – 苹果推出2D图像生成3D深度图的开源模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.