Qwen2.5-Omni-3B – 阿里 Qwen 团队推出的轻量级多模态 AI 模型
Qwen2.5-Omni-3B是什么 Qwen2.5-Omni-3B 是阿里巴巴 Qwen 团队推出的轻量级多模态 AI 模型。是 Qwen2.5-Omni-7B 的精简…
OpenMemory MCP – 基于MCP协议的本地AI记忆共享工具
OpenMemory MCP是什么 OpenMemory MCP 是mem0推出的基于开放模型上下文协议(MCP)构建的开源工具,能解决 AI 工具记忆痛点,实现不同工具…
OmniCam – 浙大联合上海交大等高校推出的多模态视频生成框架
OmniCam是什么 OmniCam 是先进的多模态视频生成框架,通过摄像机控制实现高质量的视频生成。支持多种输入模态组合,用户可以提供文本描述、视频中的轨迹或图像作为参…
Miras – 谷歌推出的深度学习架构设计通用框架
Miras是什么 Miras是谷歌推出的用在深度学习架构设计的通用框架,特别是序列建模任务。Miras基于关联记忆和注意力偏差的概念,将Transformer、现代线性R…
Parakeet TDT 0.6B – 英伟达开源的自动语音识别模型
Parakeet TDT 0.6B是什么 Parakeet TDT 0.6B 是英伟达推出的开源自动语音识别(ASR)模型。采用FastConformer编码器和TDT解…
PhysGen3D – 清华等高校联合推出的单图创建交互式 3D 场景
PhysGen3D是什么 PhysGen3D 是创新的框架,能将单张图像转换为交互式的 3D 场景,生成具有物理真实感的视频。结合了基于图像的几何和语义理解以及基于物理的…
GPT-4.1 – OpenAI 推出新一代语言模型,支持百万 token 上下文
GPT-4.1是什么 GPT-4.1 是 OpenAI 最新推出的新一代语言模型,包含 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano 三个版本。…
TesserAct – AI 4D具身世界模型,能预测3D场景的动态演变
TesserAct是什么 TesserAct 是创新的 4D 具身世界模型,能预测 3D 场景随时间的动态演变,响应具身代理的动作。通过训练 RGB-DN(RGB、深度和…
Graphiti – 开源AI动态知识图谱生成框架
Graphiti是什么 Graphiti 是为动态环境设计的 AI 知识图谱生成框架,为 AI 智能体构建能查询、具有时间感知能力的知识网络。Graphiti 能实时摄取…
AnimeGamer – 腾讯联合香港城市大学推出的动漫生活模拟系统
AnimeGamer是什么 AnimeGamer 是腾讯 PCG 和香港城市大学共同推出的无限动漫生活模拟系统。基于多模态大语言模型(MLLM),支持玩家基于开放式的语言…
SocioVerse – 复旦大学联合小红书等机构开源的社会模拟世界模型
SocioVerse是什么 SocioVerse(众生) 是复旦大学、上海创智学院、罗切斯特大学和小红书联合推出的社会模拟世界模型。基于大语言模型(LLM)驱动的智能体和…
FunGPT – 开源AI情感调节项目,基于InternLM2.5系列模型
FunGPT是什么 FunGPT 是基于 InternLM2.5 系列大模型开发的开源项目,专为情感调节设计。具备两大核心功能:甜言蜜语模式和犀利怼语模式。甜言蜜语模式能…
EmotiVoice – 网易有道开源的AI语音合成系统
EmotiVoice是什么 EmotiVoice是网易有道开源的多语言、多声音和提示控制的文本到语音(TTS)系统。EmotiVoice支持英语和中文,提供超过2000种…
Agent Development Kit – 谷歌开源的 AI Agent 开发与部署框架
Agent Development Kit是什么 Agent Development Kit(ADK)是谷歌开源的首个AI智能体开发工具包,是一个代码优先的Python工…
VoltAgent – 开源的AI Agent构建和编排框架
VoltAgent是什么 VoltAgent 是开源的 TypeScript 框架,用在构建和编排 AI Agent。VoltAgent 提供构建 AI 应用的基础结构和…
Toolkami – 开源 AI Agent 框架,七种核心工具支持运行
Toolkami是什么 Toolkami 是极简的 AI Agent 框架,用七种工具支持运行, 包括读(Read)、写(Write Diff)、浏览(Browse)、命…
