PhysGen3D – 清华等高校联合推出的单图创建交互式 3D 场景
PhysGen3D是什么 PhysGen3D 是创新的框架,能将单张图像转换为交互式的 3D 场景,生成具有物理真实感的视频。结合了基于图像的几何和语义理解以及基于物理的…
GPT-4.1 – OpenAI 推出新一代语言模型,支持百万 token 上下文
GPT-4.1是什么 GPT-4.1 是 OpenAI 最新推出的新一代语言模型,包含 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano 三个版本。…
TesserAct – AI 4D具身世界模型,能预测3D场景的动态演变
TesserAct是什么 TesserAct 是创新的 4D 具身世界模型,能预测 3D 场景随时间的动态演变,响应具身代理的动作。通过训练 RGB-DN(RGB、深度和…
Graphiti – 开源AI动态知识图谱生成框架
Graphiti是什么 Graphiti 是为动态环境设计的 AI 知识图谱生成框架,为 AI 智能体构建能查询、具有时间感知能力的知识网络。Graphiti 能实时摄取…
AnimeGamer – 腾讯联合香港城市大学推出的动漫生活模拟系统
AnimeGamer是什么 AnimeGamer 是腾讯 PCG 和香港城市大学共同推出的无限动漫生活模拟系统。基于多模态大语言模型(MLLM),支持玩家基于开放式的语言…
SocioVerse – 复旦大学联合小红书等机构开源的社会模拟世界模型
SocioVerse是什么 SocioVerse(众生) 是复旦大学、上海创智学院、罗切斯特大学和小红书联合推出的社会模拟世界模型。基于大语言模型(LLM)驱动的智能体和…
FunGPT – 开源AI情感调节项目,基于InternLM2.5系列模型
FunGPT是什么 FunGPT 是基于 InternLM2.5 系列大模型开发的开源项目,专为情感调节设计。具备两大核心功能:甜言蜜语模式和犀利怼语模式。甜言蜜语模式能…
EmotiVoice – 网易有道开源的AI语音合成系统
EmotiVoice是什么 EmotiVoice是网易有道开源的多语言、多声音和提示控制的文本到语音(TTS)系统。EmotiVoice支持英语和中文,提供超过2000种…
Agent Development Kit – 谷歌开源的 AI Agent 开发与部署框架
Agent Development Kit是什么 Agent Development Kit(ADK)是谷歌开源的首个AI智能体开发工具包,是一个代码优先的Python工…
VoltAgent – 开源的AI Agent构建和编排框架
VoltAgent是什么 VoltAgent 是开源的 TypeScript 框架,用在构建和编排 AI Agent。VoltAgent 提供构建 AI 应用的基础结构和…
Toolkami – 开源 AI Agent 框架,七种核心工具支持运行
Toolkami是什么 Toolkami 是极简的 AI Agent 框架,用七种工具支持运行, 包括读(Read)、写(Write Diff)、浏览(Browse)、命…
Awesome MCP Servers – 开源的MCP资源聚合平台,覆盖多个垂直领域
git clone https://github.com/executeautomation/mcp-playwright.git cd mcp-playwright n…
Pad.ws – 在线AI开发工具,白板功能与代码编辑器深度结合
Pad.ws是什么 Pad.ws 是创新的在线开发环境,结合了白板功能与完整的 IDE 工具。基于浏览器运行,无需安装额外软件,用户可以随时随地通过任何设备访问。将交互式…
SuperEdit – 字节跳动等机构推出的图像编辑方法
SuperEdit是什么 SuperEdit是字节跳动智能创作团队和佛罗里达中央大学计算机视觉研究中心联合推出的指令引导图像编辑方法,基于优化监督信号提高图像编辑的精度和…
MiniMax MCP Server – MiniMax 推出基于 MCP 的多模态生成服务器
MiniMax MCP Server是什么 MiniMax MCP Server 是 MiniMax 稀宇科技推出的基于模型上下文协议(MCP)的多模态生成服务器。通过简…
Aero-1-Audio – LMMs-Lab 推出的轻量级音频模型
Aero-1-Audio是什么 Aero-1-Audio 是 LMMs-Lab 开发的轻量级音频模型,基于 Qwen-2.5-1.5B 构建,仅包含 1.5 亿参数。专为…
