OpenHands – AI编程工具,多智能体协作实现代码编写、命令运行等
OpenHands是什么 OpenHands是AI编程工具,支持多智能体协作提高开发效率,减少开发者的编码工作量。OpenHands基于编写代码、与命令行交互和浏览网页等…
Hallo3 – 复旦联合百度开源的高动态与真实感肖像动画生成框架
Hallo3是什么 Hallo3是复旦大学和百度公司联合推出的,基于扩散变换器网络(Diffusion Transformer Networks)的肖像图像动画技术,能生…
清华联手智谱推出IndexCache:稀疏注意力加速技术,长上下文推理提速近2倍,零性能损失
💡 站外导读:随着大模型上下文窗口迈向百万Token时代,超长文本的处理效率成为AI落地的核心瓶颈。传统稀疏注意力(DSA)中的索引器,在200K上下文下竟占据高达81%…
VITRON – Skywork AI 联合新加坡国立、南洋理工推出的像素级视觉大型语言模型
VITRON是什么 VITRON是Skywork AI、新加坡国立大学和南洋理工大学联合推出的像素级视觉大型语言模型(LLM),能全面理解和处理静态图像与动态视频,对图像…
VideoAnydoor – 港大联合阿里达摩院等机构推出的零样本视频对象插入框架
VideoAnydoor是什么 VideoAnydoor是香港大学、阿里巴巴集团达摩院、湖畔实验室、华中科技大学联合推出的零样本的视频对象插入框架,能将特定对象以高保真度…
rStar-Math – 微软推出的小模型复杂推理与自进化SLMs的创新技术
rStar-Math是什么 rStar-Math是微软亚洲研究院推出的创新研究项目,基于蒙特卡洛树搜索(MCTS)驱动的深度思考,使小型语言模型(SLMs)在数学推理方面…
n8n – 开源工作流自动化平台,支持400多个应用程序、拖放创建复杂工作流
n8n是什么 n8n 是开源的低代码AI工作流自动化工具,基于 Node.js 构建,通过可视化界面让用户能轻松地通过拖拽节点构建自动化流程,每个节点代表一个操作或触发器…
PersonaMagic – 高保真人脸定制技术,根据肖像无缝生成新角色
PersonaMagic是什么 PersonaMagic 是创新的高保真人脸定制技术,通过阶段调节的文本条件策略实现个性化图像生成。基于简单多层感知机(MLP)网络学习一…
SPAR3D – Stability AI等机构推出的单试图重建 3D 网络模型
SPAR3D是什么 SPAR3D是Stability AI和伊利诺伊大学香槟分校推出的,先进的单图生成3D模型方法,能从单张图像中高效重建出高质量的3D对象。SPAR3D…
SoulChat2.0 – 华南理工大学推出的心理咨询师数字孪生大语言模型
SoulChat2.0是什么 SoulChat2.0是华南理工大学未来技术学院-广东省数字孪生人重点实验室基于SoulChat1.0模型推出的心理咨询师数字孪生大语言模型…
InstructMove – 东京大学联合 Adobe 推出基于指令的图像编辑模型
InstructMove是什么 InstructMove是东京大学和Adobe公司联合推出的基于指令的图像编辑模型,通过观察视频中的帧对变化学习如何根据指令进行图像操作。…
Search-o1 – 人大联合清华推出自主知识检索增强的推理框架
Search-o1是什么 Search-o1是中国人民大学和清华大学推出的创新框架,能提升大型推理模型(LRMs)在面对复杂问题时的推理能力。基于整合代理检索增强生成(R…
SAC-KG – 通用知识图谱构建框架,能构建超百万节点的领域知识图谱
SAC-KG是什么 SAC-KG是基于大型语言模型(LLMs)自动构建领域知识图谱的通用框架。由生成器、验证器和剪枝器三个主要组件构成,能自动从原始领域语料库中生成特定领…
LatentSync – 字节联合北交大开源的端到端唇形同步框架
LatentSync是什么 LatentSync是字节跳动、北京交通大学联合推出的端到端唇形同步框架,基于音频条件的潜在扩散模型,无需任何中间的3D表示或2D特征点。La…
WebWalker – 阿里推出用于评估LLMs在网页浏览任务中性能的基准工具
WebWalker是什么 WebWalker是阿里巴巴自然语言处理团队开发的用于评估和提升大型语言模型(LLMs)在网页浏览任务中性能的工具。通过模拟网页导航任务,帮助模…
ConceptMaster – 高保真多概念视频定制生成的创新 AI 框架
ConceptMaster是什么 ConceptMaster是用于多概念视频定制的创新框架,能在无需测试时调优的情况下,在扩散Transformer模型上生成高质量且概念…
