X-Fusion – 加州大学联合Adobe等机构推出的多模态融合框架
X-Fusion是什么 X-Fusion 是加州大学洛杉矶分校、威斯康星大学麦迪逊分校和 Adobe Research 联合提出的多模态融合框架,将预训练的大型语言模型(…
Context7 – 为大模型和AI编辑器提供最新文档和代码示例的平台
{ "mcpServers": { "context7": { "command": "npx", "args": ["-y", "@upstash/context7-m…
ChildMandarin – 智源联合南开开源的低幼儿童中文语音数据集
ChildMandarin是什么 ChildMandarin 是智源研究院联合南开大学计算机学院人类语言技术实验室(HLT Lab)共同推出的,针对3-5岁儿童的普通话语…
Skywork-R1V 2.0 – 昆仑万维开源的新版多模态推理模型
Skywork-R1V 2.0是什么 Skywork-R1V 2.0 是昆仑万维最新开源的多模态推理模型,专为复杂推理任务设计,具备强大的视觉与文本推理能力。模型基于混合…
Scenethesis – 英伟达推出的交互式3D场景生成框架
Scenethesis是什么 Scenethesis 是 NVIDIA 推出的创新框架,用在从文本生成交互式 3D 场景。框架结合大型语言模型(LLM)和视觉感知技术,基…
MedReason – 美国加州联合南洋理工等机构推出的医学推理框架
MedReason是什么 MedReason是美国加州大学圣克鲁斯分校、加拿大不列颠哥伦比亚大学、新加坡南洋理工大学等机构推出的医学推理框架,基于知识图谱提升大型语言模型…
Phi-4-reasoning – 微软推出的Phi-4推理模型系列
Phi-4-reasoning是什么 Phi-4-reasoning 是微软推出的 140 亿参数的推理模型,专为复杂推理任务设计。通过监督微调(SFT)训练而成,使用了…
BLIP3-o – Salesforce Research等机构推出的多模态模型
BLIP3-o是什么 BLIP3-o是Salesforce Research等机构推出的创新多模态模型,融合自回归模型的推理和指令遵循能力及扩散模型的强大生成能力。模型基…
Flex.2-preview – Ostris 推出的文本到图像扩散模型
Flex.2-preview是什么 Flex.2-preview 是Ostris开源的 80 亿参数文本到图像扩散模型,支持通用控制输入(如线条、姿态、深度)和内置修复功…
Seed-Coder – 字节跳动开源的代码模型系列
Seed-Coder是什么 Seed-Coder是字节跳动开源的8B规模代码模型系列,提升代码生成与理解能力。包含Base、Instruct和Reasoning三个版本,…
Seaweed-7B – 字节推出的视频生成模型
Seaweed-7B是什么 Seaweed-7B 是字节跳动团队推出的视频生成模型,拥有约 70 亿参数。Seaweed-7B具备强大的视频生成能力。模型支持从文本描述、…
Paper2Coder – 一键将学术论文转为代码库的AI系统
Paper2Code是什么 Paper2Code 是韩国科学技术院和DeepAuto.ai联合推出的多 Agent 大语言模型(LLM)框架,支持将机器学习领域的科学论文…
DreamGen – 英伟达推出的新型机器人学习技术
DreamGen是什么 DreamGen是英伟达推出的创新的机器人学习技术,基于AI视频世界模型生成合成数据,让机器人能在梦境中学习新技能。DreamGen仅需少量现实视…
DAM-3B – 英伟达推出的多模态大语言模型
DAM-3B是什么 DAM-3B(Describe Anything 3B)是英伟达推出的多模态大语言模型,专为生成图像和视频中特定区域的详细描述设计。模型通过点、边界框…
LegoGPT – 卡内基梅隆大学推出的乐高积木设计模型
LegoGPT是什么 LegoGPT 是卡内基梅隆大学推出的乐高积木设计模型,支持基于文本提示生成物理稳定且能构建的乐高积木模型。LegoGPT 基于自回归语言模型和大规…
HoloTime – 北大联合鹏城实验室推出的全景4D场景生成框架
HoloTime是什么 HoloTime 是北京大学深圳研究生院和鹏城实验室推出的全景 4D 场景生成框架,基于视频扩散模型将单张全景图像转化为具有真实动态效果的全景视频…
