story-flicks – AI视频生成工具,一键生成高清故事短视频
story-flicks是什么 story-flicks 是基于AI大模型的项目,支持一键生成高清故事短视频。用户输入故事主题后,系统基于AI技术生成包含图像、文本、音频…
Janus-Pro – DeepSeek 开源的统一多模态模型
Janus-Pro是什么 Janus-Pro是 DeepSeek 推出的开源AI模型,支持图像理解和图像生成,提供 1B 和 7B 两种规模,适配多元应用场景。通过改进的…
Step-2 mini – 阶跃星辰推出的轻量级极速大模型
Step-2 mini是什么 Step-2 mini 是阶跃星辰推出的轻量级极速大模型,基于新一代自研 Attention 架构 MFA 开发。仅用 3% 的参数量就保留…
MinMo – 阿里通义实验室推出的多模态语音交互大模型
MinMo是什么 MinMo是阿里巴巴通义实验室FunAudioLLM团队推出的多模态大模型,专注于实现无缝语音交互。MinMo拥有约80亿参数,基于多阶段训练,在140…
SigStyle – 吉大联合 Adobe 等机构推出的风格迁移框架
SigStyle是什么 SigStyle 是吉林大学、南京大学智能科学与技术学院及Adobe推出的新型签名风格迁移框架,支持将单张风格图像中独特的视觉特征(如几何结构、色…
MarS – 微软亚洲研究院开源的金融市场模拟预测引擎
MarS是什么 MARS(Market Simulation)是微软亚洲研究院推出的金融市场模拟预测引擎,基于生成型基础模型LMM(Large Market Model)…
SeedVR – 南洋理工和字节跳动推出的扩散变换器模型,实现通用视频修复
SeedVR是什么 SeedVR是南洋理工大学和字节跳动推出的扩散变换器模型,能实现高质量的通用视频修复。SeedVR基于引入移位窗口注意力机制,采用大尺寸(64×64)…
NobodyWho – AI游戏引擎插件,本地运行 LLM 实现互动小说创作
NobodyWho是什么 NobodyWho是为 Godot 游戏引擎设计的插件,通过本地运行的大型语言模型(LLM)实现互动小说创作。支持 Windows、Linux …
Phantom – 字节跳动推出的主体一致视频生成框架
Phantom是什么 Phantom是字节跳动智能创作团队推出的用在主体一致视频生成(Subject-to-Video, S2V)的框架。基于跨模态对齐技术,结合文本和图…
Granite 3.2 – IBM 开源的多模态系列 AI 模型
Granite 3.2是什么 Granite 3.2 是IBM开源的多模态AI模型系列,具备强大的推理、视觉理解和预测能力。Granite 3.2包含多个版本, Gran…
LangBot – 多模态即时聊天机器人构建与管理的开源平台
LangBot是什么 LangBot 是开源的即时聊天机器人平台,支持多平台(如 QQ、微信、飞书、Discord 等)和多种大语言模型(如 ChatGPT、DeepSe…
MatAnyone – 南洋理工和商汤科技推出的人像视频抠图框架
MatAnyone是什么 MatAnyone是南洋理工大学S-Lab实验室和商汤科技推出的,针对复杂背景人像视频抠图的先进框架,专注于目标指定的视频抠图任务。MatAny…
CSM – Sesame团队推出的语音对话模型
CSM是什么 CSM(Conversational Speech Model)是Sesame团队推出的新型语音对话模型,提升语音助手的自然度和情感交互能力。CSM基于多模…
Qwen2.5-VL – 阿里通义千问开源的视觉语言模型
Qwen2.5-VL是什么 Qwen2.5-VL是阿里通义千问团队开源的旗舰视觉语言模型,具有3B、7B和72B三种不同规模。模型在视觉理解方面表现出色,能识别常见物体,…
FramePainter – 哈工大联合华为诺亚推出的交互式图像编辑AI工具
FramePainter是什么 FramePainter 是基于 AI 的交互式图像编辑工具,通过结合视频扩散模型和直观的草图控制,让用户能通过简单的绘制、点击或拖动操作…
MiniMax-01 – MiniMax开源的全新系列模型
MiniMax-01是什么 MiniMax-01是MiniMax推出的全新系列模型,包含基础语言大模型MiniMax-Text-01和视觉多模态大模型MiniMax-VL…
