ACE++ – 阿里通义推出的升级版图像生成与编辑模型
ACE++是什么 ACE++是阿里巴巴通义实验室推出的先进的图像生成与编辑工具,通过指令化和上下文感知的内容填充技术,实现了高质量的图像创作和编辑功能。ACE++ 提供多…
Llama Nemotron – 英伟达推出的系列推理模型
Llama Nemotron是什么 Llama Nemotron是NVIDIA推出的一系列推理模型,专注于推理和多种智能代理(agentic AI)任务。模型基于Llam…
Image-01 – MiniMax 推出的文本到图像生成模型
Image-01是什么 Image-01 是 MiniMax 推出的先进文本到图像生成模型,具备卓越的图像生成能力。能将用户输入的文本描述精准转化为高质量图像,支持多种纵…
SyncAnimation – 南科大等推出的实时音频驱动生成头部运动框架
SyncAnimation是什么 SyncAnimation是实时端到端的音频驱动框架,用于生成人体姿态和说话头像动画。通过音频信号实时生成与音频同步的上半身姿态和面部表…
DiffEditor – 北大联合腾讯推出的细粒度图像编辑工具
DiffEditor是什么 DiffEditor是北京大学深圳研究生院与腾讯PCG的研究团队提出的基于扩散模型(Diffusion Model)的图像编辑工具,通过引入图…
PlanGEN – 谷歌研究团队推出的多智能体框架
PlanGEN是什么 PlanGEN 是谷歌研究团队推出的多智能体框架,通过多智能体协作、约束引导和算法自适应选择,解决复杂问题的规划和推理。包含三个关键组件:约束智能体…
Skywork R1V – 昆仑万维开源的多模态思维链推理模型
Skywork R1V是什么 Skywork R1V是昆仑万维开源的首款工业界多模态思维链推理模型,具备强大的视觉链式推理能力。Skywork R1V能对视觉输入进行多步…
CogView-3-Flash – 智谱推出的首个免费AI图像生成模型
CogView-3-Flash 是什么 CogView-3-Flash 是智谱推出的首个免费AI图像生成模型,能根据文本描述生成高审美分数的图像,支持多种分辨率,满足专业…
文心大模型X1 Turbo – 百度推出的最新深度思考型模型
文心大模型X1 Turbo是什么 文心大模型X1 Turbo是百度推出的深度思考型模型,是文心大模型4.5 Turbo的升级版本,具备更先进的思维链和深度思考理能力,擅长…
DanceGRPO – 字节Seed联合港大推出的统一视觉生成强化学习框架
DanceGRPO是什么 DanceGRPO 是字节跳动 Seed 和香港大学联合推出的首个统一视觉生成强化学习框架。将强化学习应用在视觉生成领域,覆盖两大生成范式(di…
AI-ClothingTryOn – AI虚拟试穿应用,支持生成多版本试衣效果
AI-ClothingTryOn是什么 AI-ClothingTryOn 是基于 Python 的桌面应用程序,用 Google Gemini AI 技术实现虚拟试衣功能…
Phi-4-Multimodal – 微软最新推出的多模态语言模型
Phi-4-Multimodal是什么 Phi-4-Multimodal 是微软最新推出的多模态语言模型,拥有 56 亿参数,能将语音、视觉和文本处理集成到一个统一架构中…
阿里巴巴宣布大模型组织架构升级,成立Token Foundry事业部并设立AI未来研究院
阿里巴巴今日宣布对AI业务组织架构进行重大升级,合并通义大模型事业部与未来生活实验室,正式成立Token Foundry事业部,由集团CEO吴泳铭直接负责。同时,阿里巴巴…
影视圈又一重磅联手!生数科技牵手华策,加速 AI 视频从“创意辅助”迈向“真实生产”
随着生成式 AI 的浪潮席卷内容产业,影视行业的生产范式正经历前所未有的重构。 6 月 7 日,在桐庐举办的华策 AIGC 高科技影视创制中心启航活动上,人工智能领域的新…
Step-Video-T2V – 阶跃星辰开源的文本到视频模型
Step-Video-T2V是什么 Step-Video-T2V 是阶跃星辰团队推出的开源文本到视频预训练模型,拥有 300 亿参数,能生成长达 204 帧的高质量视频。…
OpenAI o4-mini – OpenAI推出的小型推理模型
OpenAI o4-mini是什么 OpenAI o4-mini 是OpenAI推出的小型推理模型,专为快速、经济高效的推理而优化。OpenAI o4-mini 在数学、…
