Boogu-Image-0.1 – Boogu开源的统一图像生成与编辑模型
Boogu-Image-0.1是什么 Boogu-Image-0.1 是 Boogu 团队开源的统一图像生成与编辑模型家族。模型在同一架构下同时支持文生图、指令式图像编辑…
豆包音频生成模型1.0 – 火山引擎推出的端到端音频创作模型
豆包音频生成模型1.0是什么 豆包音频生成模型1.0(Seed-Audio 1.0)是火山引擎推出的端到端音频创作模型,支持文本或音频作为参考输入生成目标音频。模型单条P…
Seedance 2.5 – 字节跳动推出的最新视频生成模型
Seedance 2.5是什么 Seedance 2.5 是字节跳动旗下豆包视频生成模型的最新旗舰版本,预计 7 月初全面上线。作为 Seedance 2.0 的重大升级…
Unlimited-OCR – 百度开源的端到端长文档 OCR 模型
Unlimited-OCR是什么 Unlimited-OCR 是百度推出的端到端长文档 OCR 模型,通过 Reference Sliding Window Attent…
MMSkills – 上海交大与小红书联合推出的多模态技能框架
MMSkills是什么 MMSkills 是上海交通大学与小红书联合推出的面向通用视觉 Agent 的多模态技能框架,支持将可复用技能从纯文本步骤扩展为包含文本流程、运行…
Ornith-1.0 – DeepReinforce 开源的 Agentic 编程系列模型
Ornith-1.0是什么 Ornith-1.0 是 DeepReinforce 团队推出的专为 Agentic 编程任务设计的开源大模型系列,模型基于 Gemma 4 …
DSpark – DeepSeek 联合北京大学开源的推测解码加速框架
DSpark是什么 DSpark 是 DeepSeek 联合北京大学开源的推测解码加速框架,专门解决大模型自回归生成速度慢、像”挤牙膏”的痛点。采用半自回归生成架构,通过…
Confucius4-TTS – 网易有道开源的多语言语音合成引擎
Confucius4-TTS是什么 Confucius4-TTS 是网易有道开源的 1.3B 参数多语言语音合成引擎。模型只需 3 秒参考音频可零样本克隆音色,无需参考文…
Baichuan-M4 – 百川智能联合清华推出的医疗增强模型
Baichuan-M4是什么 Baichuan-M4是百川智能联合清华大学推出的新一代医疗增强大模型,在 HealthBench 综合、Hard、Professional…
HTML Anything – nexu-io 团队开源的 HTML 编辑器
HTML Anything是什么 HTML Anything 是 nexu-io 团队开源的 Agent 时代 HTML 编辑器,内置 75 套 Skill 模板覆盖杂志…
JoyAI-VL-Interaction – 京东开源的实时视频视觉语言交互模型
JoyAI-VL-Interaction是什么 JoyAI-VL-Interaction 是京东 Joy Future Academy 开源的实时视频视觉语言交互模型,是…
Mistral OCR 4 – Mistral AI 推出的最新一代文档理解模型
Mistral OCR 4是什么 Mistral OCR 4 是 Mistral AI 推出的最新一代文档理解模型。模型支持从 PDF、图片、演示文稿等复杂文档中提取文本…
yuxinlu1 Gemma4-12B – 开源的编程与 Agentic 模型系列
yuxinlu1 Gemma4-12B 是什么 yuxinlu1 Gemma4-12B 是个人开发者逯雨鑫基于 Google Gemma 4 12B 指令模型微调的开源编…
虎牙VAM 1.0 – 虎牙推出的实时多模态数字人基础模型
虎牙VAM 1.0是什么 虎牙VAM 1.0(Vivid Avatar Model)是虎牙推出的基于DiT架构的实时多模态数字人基础模型,一张照片可生成能说话、能唱歌跳舞…
Penpot – 开源的设计与代码协作平台,多人实时协作
Penpot是什么 Penpot 是开源的设计与代码协作平台,基于 SVG、CSS、HTML 等开放标准构建,可在浏览器中完成 UI 设计与交互原型制作。平台支持多人实时…
GPT-5.6 – OpenAI 推出的最新一代大语言模型系列
GPT-5.6是什么 GPT-5.6 是 OpenAI 推出的最新一代大语言模型,目前受美国政府监管要求仅以”有限预览”形式向少数可信合作伙伴开放。系列首次采用天文学命名…
