AutoDev – 微软推出的AI编程和程序开发智能体框架
AutoDev是什么 AutoDev是由微软的研究人员推出的一个AI编程工具,专门设计用于自主规划和执行复杂的软件工程任务,如代码编写、调试、测试和版本控制等。AutoD…
MARS5-TTS – 开源的AI声音克隆工具,支持140+语言
MARS5-TTS是什么 MARS5-TTS是CAMB.AI推出开源的AI声音克隆工具,有突破性逼真的韵律,支持140多种语言支持。还能处理复杂韵律场景,如体育解说和动漫…
OpenCity – AI交通预测模型,卓越的零样本预测和情境适应能力
OpenCity是什么 OpenCity是由香港大学联合华南理工大学和百度共同研发的交通预测模型。OpenCity采用Transformer架构和图神经网络,通过大规模预…
Seed-TTS – 字节跳动推出的高质量文本到语音生成模型
Seed-TTS是什么 Seed-TTS是由字节跳动开发的高级文本到语音(Text to Speech,TTS)模型,能够生成与人类语音极为相似的高质量语音,具备出色的上…
Lepton Search – 开源的对话式AI搜索引擎项目
Lepton Search是什么 Lepton Search是由原阿里巴巴技术副总裁和AI科学家贾扬清创办的Lepton AI应用构建平台开源的一个对话式AI搜素引擎,该…
LingBot-Video – 蚂蚁灵波开源面向具身智能的视频模型
LingBot-Video是什么 LingBot-Video 是蚂蚁灵波科技开源的全球首个面向具身智能的 MoE 视频生成基础模型。模型基于 DiT + MoE 架构,总…
Robostral Navigate – Mistral AI 推出的具身智能导航模型
Robostral Navigate是什么 Robostral Navigate 是 Mistral AI 推出的首个具身智能导航模型,用一个普通 RGB 摄像头可让机器…
NodeTool – AI工作流可视化构建器,拖放节点设计复杂工作流
NodeTool是什么 NodeTool是开源的AI工作流可视化构建器。NodeTool集成广泛的AI工具和模型,基于简单、可视化的界面,让用户无需编码即可快速原型设计和…
ORMBG – 开源的AI图像分割工具
ORMBG是什么 ORMBG是开源的AI图像分割工具,由开发者schirrmacher在GitHub上发起。ORMBG专注于从图片中准确去除背景,用先进的图像处理技术,实…
Grok-1 – 马斯克旗下xAI开源的大模型,参数量3140亿
Grok-1是什么 Grok-1 是由马斯克旗下的人工智能初创公司 xAI 开发的一款大型语言模型,是一个混合专家(MoE)模型,拥有 3140 亿参数,使其成为目前参数…
HeadGAP – 字节跳动推出的3D头像生成模型
HeadGAP是什么 HeadGAP是字节跳动和上海科技大学共同推出的3D头像生成模型,仅用少量图片快速生成逼真的3D头像。采用先验学习和个性化创建阶段的框架,基于大规模…
Eagle – 英伟达推出的多模态大模型,擅长高分辨率图像处理
Eagle是什么 Eagle是英伟达推出的多模态大模型,擅长处理高达1024×1024像素的图像,显著提升视觉问答和文档理解能力。Eagle模型采用多专家视觉编码器架构,…
Qwen2 – 阿里云开源的新一代通义千问大模型
Qwen2是什么 Qwen2是由阿里云通义千问团队开源的新一代大语言模型,该系列涵盖了从0.5B到72B不等的五个规模模型,在中文和英文基础上增加了27种语言的高质量数据…
Follow Your Pose – 开源的姿态全可控视频生成框架
Follow Your Pose是什么 Follow Your Pose是由清华大学、香港科技大学、腾讯AI Lab以及中科院的研究人员开源的一个基于文本到视频生成的框架…
VMB – 中科院联合多所高校机构推出增强多模态音乐生成的框架
VMB是什么 VMB(Visuals Music Bridge)是中国科学院信息工程研究所、中国科学院大学网络空间安全学院、上海人工智能实验室、上海交通大学等机构推出的多…
Cradle – 通用计算机控制的多模态AI Agent框架
Cradle是什么 Cradle是面向通用计算机控制(General Computer Control, GCC)的多模态AI Agent框架,由昆仑万维携手北京智源人工…
