Transfusion – Meta推出的文本与图像融合的多模态AI模型
Transfusion是什么 Transfusion是Meta公司最新推出的文本与图像融合的多模态AI模型,Transfusion通过结合语言模型的下一个token预测和…
ChopperBot – AI直播视频剪辑和发布机器人,自动化管理直播内容
ChopperBot是什么 ChopperBot是一款智能化的直播视频剪辑和发布机器人,ChopperBot能自动化地管理和分发直播内容。支持多个流行直播平台,如斗鱼、虎…
abab-video-1 – MiniMax推出的首款AI高清视频生成模型
abab-video-1是什么 abab-video-1是MiniMax公司推出的首款AI高清视频生成模型,模型支持生成最高1280×720分辨率、25fps的高清视频,…
LongVILA – 面向长视频理解的视觉语言AI模型
LongVILA是什么 LongVILA是一个面向长视频理解的视觉语言AI模型,由英伟达、MIT、UC 伯克利、得克萨斯大学奥斯汀分校共同开发。通过算法和系统的共同设计,…
T2V-Turbo – 谷歌开源的文本到视频生成模型
T2V-Turbo是什么 T2V-Turbo是一种先进的文本到视频生成模型,由Google、UC Santa Barbara(加利福尼亚大学圣塔芭芭拉分校)、和Unive…
SAM2Point – 基于SAM2的零样本3D分割技术,增强3D分割精确度
SAM2Point是什么 SAM2Point是基于SAM2的3D分割技术,无需额外训练或 2D-3D 投影,直接对任意3D数据进行零样本分割。通过将3D数据体素化,模拟为…
Westlake-Omni – 西湖心辰开源的中文情感端到端语音交互模型
Westlake-Omni是什么 Westlake-Omni 是西湖心辰推出的全球首个开源中文情感端到端语音交互大模型。模型采用离散表示法,统一文本和语音模态的处理,特别…
Kheish – 开源的多智能体协调平台,可灵活配置多个Agent解决复杂任务
Kheish是什么 Kheish是基于大型语言模型(LLM)的多智能体编排开源平台,用多个专门的角色(智能体)和灵活的工作流协调复杂任务的各个步骤,如提案生成、审核、验证…
RAGFlow – 基于OCR和文档解析的下一代 RAG 引擎
RAGFlow是什么 RAGFlow 是开源的 RAG(Retrieval-Augmented Generation)引擎,拥有深入理解文档并增强生成能力,是基于OCR和…
FineZip – AI驱动的无损文本压缩系统,实现快速和高压缩比
FineZip是什么 FineZip 是一种基于大型语言模型(LLMs)的无损文本压缩系统,结合在线记忆和动态上下文大小技术,提高文本压缩的速度和效率。在线记忆指的是在压…
abab-music-1 – MiniMax 推出端到端 AI 音乐生成大模型
abab-music-1是什么 abab-music-1 是 MiniMax 推出的一款端到端 AI 音乐生成大模型。支持多功能端到端音乐生成,能合成多种音乐形式,包括纯…
LeRobot – HuggingFace推出的开源AI聊天机器人项目
LeRobot是什么 LeRobot是由HuggingFace推出的开源AI聊天机器人项目,由前特斯拉研究员Remi Cadene领导开发。LeRobot致力于降低机器人…
FLUX.1-Turbo-Alpha – 阿里推出的文本到图像生成模型,基于FLUX.1-dev
FLUX.1-Turbo-Alpha是什么 FLUX.1-Turbo-Alpha是阿里妈妈创意团队基于FLUX.1-dev模型训练的8步蒸馏Lora模型。基于多头判别器技…
CodeFuse-muAgent – 蚂蚁CodeFuse团队推出开源的多智能体框架
CodeFuse-muAgent是什么 CodeFuse-muAgent 是蚂蚁集团 CodeFuse 团队开发的多智能体框架,基于知识图谱引擎来驱动智能体的编排和协作。…
AutoGen Studio – 微软开源的零代码构建多智能体系统的AI工具
AutoGen Studio是什么 AutoGen Studio 是微软研究院推出的一款开源界面工具,旨在简化多智能体系统的构建、调试和评估过程。AutoGen Stud…
HelloMeme – 面部表情与姿态迁移框架,基于Stable Diffusion 1.5模型理解能力
HelloMeme是什么 HelloMeme是基于最新的Diffusion生成技术的框架,实现表情与姿态的迁移,HelloMeme集成空间编织注意力(Spatial Kn…
