MM-StoryAgent – 上海交大联合阿里开源的多智能体故事绘本视频生成框架

最近更新: 2026年6月8日下午2:18

MM-StoryAgent是什么

MM-StoryAgent 是上海交通大学X-LANCE实验室和阿里巴巴集团联合推出的开源多模态、多智能体框架，用在生成沉浸式的有声故事绘本视频。基于结合大型语言模型（LLMs）和多种模态的生成工具（如文本、图像、音频），用多阶段写作流程和模态特定的提示修订机制，提升故事的吸引力和沉浸感。框架支持灵活的模块化设计，能替换不同的生成模型和API。MM-StoryAgent 提高了故事质量，在图像、语音、音乐和音效之间实现更好的对齐效果，为儿童故事书的自动化创作提供了高效、灵活且富有表现力的解决方案。

阅读目录

MM-StoryAgent是什么
MM-StoryAgent的主要功能
MM-StoryAgent的技术原理
MM-StoryAgent的项目地址
MM-StoryAgent的应用场景

MM-StoryAgent

MM-StoryAgent的主要功能

高质量故事生成：基于多智能体协作和多阶段写作流程，生成具有吸引力、教育性和情感共鸣的故事内容。
多模态内容生成：结合文本、图像、语音、音乐和音效等多种模态，为用户带来丰富的沉浸式体验。
角色一致性：在图像生成中，基于角色提取和提示修订，确保故事中的角色在视觉上保持一致。
模态对齐：基于提示修订和对比学习模型，优化文本与图像、音频之间的对齐效果，提升整体故事的连贯性。
灵活的模块化设计：支持灵活替换生成模块（如不同的文本生成模型、图像生成模型等），便于开发者根据需求进行定制和优化。

MM-StoryAgent的技术原理

多智能体协作架构：模拟业余作者与专家之间的对话，生成故事大纲和章节内容。对话过程模拟人类的头脑风暴，为故事提供更丰富的创意和吸引力。针对图像、音频等不同模态的需求，将文本故事转化为适合生成模型的提示内容。基于“修订者-审核者”的多轮协作，优化提示的质量。
多模态生成技术：
- 文本生成：基于大型语言模型（LLMs）生成故事文本。
- 图像生成：用扩散模型（如 StoryDiffusion）生成与故事内容一致的图像，并通过角色提取确保角色在多帧图像中保持一致。
- 音频生成：基于文本到语音（TTS）模型生成旁白，用 AudioLDM2 或 MusicGen 等模型生成音效和背景音乐。
- 视频合成：将生成的图像、音频和文本内容合成，形成完整的有声故事视频。
模态对齐优化：用对比学习模型（如 CLIP、CLAP）评估生成内容与文本之间的对齐程度，基于提示修订机制优化生成效果。
模块化设计：框架支持灵活替换不同的生成模型和API，开发者根据需求选择更先进的模型提升生成质量。

MM-StoryAgent的项目地址

GitHub仓库：https://github.com/X-PLUG/MM_StoryAgent
arXiv技术论文：https://arxiv.org/pdf/2503.05242
在线体验Demo：https://huggingface.co/spaces/wsntxxn/MM-StoryAgent

MM-StoryAgent的应用场景

儿童教育与娱乐：生成有趣且富有教育意义的有声故事视频，陪伴儿童学习和成长。
数字内容创作：为创作者快速生成多模态故事内容，降低创作成本，提高效率。
在线教育：辅助教学，用故事形式讲解知识，增强学习趣味性。
多媒体出版：自动化生成有声绘本，助力出版社快速制作多媒体内容。
智能设备集成：应用于智能音箱、平板等设备，提供个性化的故事生成服务。

UniAct – 清华、商汤、北大、上海AI Lab共同推出的具身基础模型框架

谛韵DiffRhythm – 西北工业联合港中文推出的端到端音乐生成工具

发表评价

MM-StoryAgent – 上海交大联合阿里开源的多智能体故事绘本视频生成框架

MM-StoryAgent是什么

MM-StoryAgent的主要功能

MM-StoryAgent的技术原理

MM-StoryAgent的项目地址

MM-StoryAgent的应用场景

发表评价取消回复

最近更新

AutoGLM-Web – AI浏览器助手，模拟用户进行网页浏览与交互

OmniGen – 统一图像生成的扩散模型，支持多模态输入

CogAgent – 清华与智谱AI联合推出的多模态视觉大模型

OMNE Multiagent – 天桥脑科学研究院推出的大模型多智能体框架

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

Support

MM-StoryAgent是什么

MM-StoryAgent的主要功能

MM-StoryAgent的技术原理

MM-StoryAgent的项目地址

MM-StoryAgent的应用场景

发表评价 取消回复

最近更新

相关推荐

发表评价取消回复