XGrammar – 陈天奇团队推出的LLM结构化生成引擎
XGrammar是什么 XGrammar是由陈天奇团队推出的开源软件库,能为大型语言模型(LLM)提供高效、灵活且可移植的结构化数据生成能力。基于上下文无关语法(CFG)…
Edify 3D – NVIDIA 推出的3D生成模型
Edify 3D是什么 Edify 3D 是 NVIDIA 推出的先进3D资产生成方案,能从文本提示或参考图像快速合成高质量的3D模型。Edify 3D能在两分钟内生成具…
SongCreator – AI音乐模型,能理解、生成和编辑歌曲
SongCreator是什么 SongCreator是清华大学深圳国际研究生院、香港中文大学等机构推出的AI音乐生成模型,能从歌词出发生成包含声乐和伴奏的完整歌曲。基于双…
Teacher2Task – 谷歌推出的多教师学习框架
Teacher2Task什么 Teacher2Task是谷歌团队推出的多教师学习框架,引入教师特定的输入标记和重新构思训练过程,消除对手动聚合启发式方法的需求。框架不依赖…
DynaSaur – Adobe 推出的大语言模型代理框架
DynaSaur是什么 DynaSaur是Adobe Research推出的大型语言模型(LLM)代理框架,突破传统LLM代理系统受限于预定义动作集合的限制。框架支持代理…
Takin AudioLLM – 喜马拉雅推出的系列零样本语音生成模型
Takin AudioLLM是什么 Takin AudioLLM是喜马拉雅Everest团队推出的一系列高质量零样本语音生成模型,包括Takin TTS、Takin VC…
AutoTrain – Hugging Face 开源的无代码模型训练平台
AutoTrain是什么 AutoTrain(AutoTrain Advanced)是Hugging Face推出的开源无代码平台,能简化最先进模型的训练过程。支持用户无…
CAMPHOR – 苹果推出的端侧小语言模型多智能体框架
CAMPHOR是什么 CAMPHOR是苹果团队推出的端侧小语言模型(SLM)多智能体框架,能提升移动设备的隐私保护和响应速度。框架基于在设备本地处理多个用户输入并进行个人…
ACE – 阿里通义实验室推出的全能图像生成和编辑模型
ACE是什么 ACE(All-round Creator and Editor)是阿里巴巴集团Tongyi Lab推出的基于扩散变换器的全能图像生成和编辑模型。ACE引入…
ViewExtrapolator – 南洋理工联合UCAS团队推出的新型视图合成方法
ViewExtrapolator是什么 ViewExtrapolator是南洋理工大学、UCAS研究团队共同推出的新视角外推方法,基于稳定视频扩散(Stable Vide…
OpenScholar – 华盛顿大学联合艾伦研究所开源的学术搜索工具
OpenScholar是什么 OpenScholar是华盛顿大学和艾伦AI研究所共同推出的检索增强型语言模型(LM),能帮助科学家基于检索和综合科学文献中的相关论文回答问…
SmolVLM – Hugging Face推出的轻量级视觉语言模型
SmolVLM是什么 SmolVLM是Hugging Face推出的轻量级视觉语言模型,专为设备端推理设计。以20亿参数量,实现了高效内存占用和快速处理速度。SmolVL…
OneDiffusion – 无缝支持双向图像合成和理解的开源扩散模型
OneDiffusion是什么 OneDiffusion是AI2推出的多功能大规模扩散模型,能无缝支持双向图像合成和理解,涵盖文本到图像生成、条件图像生成、图像理解等多种…
LongAlign – 港大推出的提升文本到图像扩散模型处理长文本对齐方法
LongAlign是什么 LongAlign是香港大学研究团队推出的文本到图像(T2I)扩散模型的改进方法,能提升长文本输入的对齐精度。LongAlign用段级编码技术,…
ebook2audiobookXTTS – 开源电子书转有声书 AI 工具,支持16种语言
ebook2audiobookXTTS是什么 ebook2audiobookXTTS是开源的AI工具,能将电子书转换为有声书。ebook2audiobookXTTS支持多…
Optima – 清华联合北邮推出优化通信效率和任务有效性的训练框架
Optima是什么 Optima是清华大学推出的优化基于大型语言模型(LLM)的多智能体系统(MAS)的框架。基于一个迭代的生成、排名、选择和训练范式,显著提高通信效率和…
