Phidias – 检索增强的3D内容生成模型,支持多模态输入
Phidias是什么 Phidias是一个先进的3D内容生成模型,将检索增强生成(RAG)的概念引入到3D建模领域。模型能基于用户提供的或从大型数据库中检索到的3D参考模…
ASAL – Sakana AI 联合 OpenAI 等推出使用基础模型搜索人工生命的系统
ASAL是什么 ASAL(Automated Search for Artificial Life)是用基础模型自动化搜索人工生命(ALife)的系统。ASAL是Saka…
StoryDiffusion – 生成一致性图像和视频序列的开源AI框架
StoryDiffusion是什么 StoryDiffusion是一个先进的AI图像和视频生成框架,用于从文本描述生成具有一致性的图像和视频序列。基于Consistent…
TANGO – 东京大学和CyberAgent AI Lab推出声音驱动全身手势视频生成框架
TANGO是什么 TANGO 是一个由东京大学和 CyberAgent AI Lab 共同推出的开源框架,专注于生成与目标语音同步的全身手势视频。基于分层音频运动嵌入和扩…
Movie Gen – Meta推出文本驱动的AI视频生成与编辑工具
Movie Gen是什么 Movie Gen 是 Meta 推出的AI视频生成工具,能根据文本提示生成和编辑视频,为视频配上同步音频。技术包括创建长达16秒的高清视频、为…
Browser Use – AI 浏览器助手,自动执行网页中的交互任务
Browser Use是什么 Browser Use是专门为大语言模型服务的智能浏览器工具,创新的Python工具库,让AI代理能像人类一样自然地浏览和操作网页。Brow…
Crawl4AI – 基于Python的异步爬虫框架,高效同时处理多个网页
Crawl4AI是什么 Crawl4AI是一款用 Python 开发的异步爬虫框架,专为大型语言模型(LLMs)和人工智能(AI)应用设计,简化网络爬虫和数据提取流程。基…
Nemotron-70B-Instruct – 英伟达推出的大语言模型
Nemotron-70B-Instruct 是什么 Nemotron-70B-Instruct 是英伟达(NVIDIA)推出的一个大型语言模型,基于一种新颖的混合训练方法…
Mini-LLaVA – 基于Llama 3.1的轻量级多模态大语言模型
Mini-LLaVA是什么 Mini-LLaVA是一款轻量级的多模态大语言模型,由清华大学和北京航空航天大学的研究团队联合开发。能处理图像、文本和视频输入,实现高效的多模…
TRELLIS – 微软联合清华和中科大推出的高质量 3D 生成模型
TRELLIS是什么 TRELLIS是清华大学、中国科学技术大学和微软研究院推出的3D生成模型,基于Structured LATent(SLAT)表示法,从文本或图像提示…
Wren AI – 开源文本驱动的SQL数据库查询解决方案
Wren AI是什么 Wren AI 是一个开源的文本到 SQL 解决方案,基于自然语言处理技术,支持用户通过自然语言提问执行数据库查询,无需编写复杂的 SQL 代码。支…
Sana – 英伟达、麻省和清华联合推出的文本到图像生成框架
Sana是什么 SANA是由NVIDIA、麻省理工学院和清华大学共同推出的文本到图像生成框架,能高效地生成高达4096×4096分辨率的高清晰度图像。SANA基于深度压缩…
MemoryScope – 为LLM聊天机器人配备的长期记忆系统
MemoryScope是什么 MemoryScope是一个为大型语言模型(LLM)聊天机器人设计的长期记忆系统。通过构建一个框架,使机器人记住用户的基础信息、习惯和偏好,…
悟界·RoboBrain Orca – 智源研究院推出的通用世界基础模型
悟界·RoboBrain Orca是什么 悟界·RoboBrain Orca 是智源研究院推出的多模态表征世界模型,以下一个状态预测替代传统下一个词/帧/动作预测,让 A…
Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion是什么 Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式语言模型,在单一架构内统一自回归、扩散…
MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型
MoWorld是什么 MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU…
