RAGFlow – 基于OCR和文档解析的下一代 RAG 引擎
RAGFlow是什么 RAGFlow 是开源的 RAG(Retrieval-Augmented Generation)引擎,拥有深入理解文档并增强生成能力,是基于OCR和…
FineZip – AI驱动的无损文本压缩系统,实现快速和高压缩比
FineZip是什么 FineZip 是一种基于大型语言模型(LLMs)的无损文本压缩系统,结合在线记忆和动态上下文大小技术,提高文本压缩的速度和效率。在线记忆指的是在压…
abab-music-1 – MiniMax 推出端到端 AI 音乐生成大模型
abab-music-1是什么 abab-music-1 是 MiniMax 推出的一款端到端 AI 音乐生成大模型。支持多功能端到端音乐生成,能合成多种音乐形式,包括纯…
LeRobot – HuggingFace推出的开源AI聊天机器人项目
LeRobot是什么 LeRobot是由HuggingFace推出的开源AI聊天机器人项目,由前特斯拉研究员Remi Cadene领导开发。LeRobot致力于降低机器人…
FLUX.1-Turbo-Alpha – 阿里推出的文本到图像生成模型,基于FLUX.1-dev
FLUX.1-Turbo-Alpha是什么 FLUX.1-Turbo-Alpha是阿里妈妈创意团队基于FLUX.1-dev模型训练的8步蒸馏Lora模型。基于多头判别器技…
CodeFuse-muAgent – 蚂蚁CodeFuse团队推出开源的多智能体框架
CodeFuse-muAgent是什么 CodeFuse-muAgent 是蚂蚁集团 CodeFuse 团队开发的多智能体框架,基于知识图谱引擎来驱动智能体的编排和协作。…
AutoGen Studio – 微软开源的零代码构建多智能体系统的AI工具
AutoGen Studio是什么 AutoGen Studio 是微软研究院推出的一款开源界面工具,旨在简化多智能体系统的构建、调试和评估过程。AutoGen Stud…
HelloMeme – 面部表情与姿态迁移框架,基于Stable Diffusion 1.5模型理解能力
HelloMeme是什么 HelloMeme是基于最新的Diffusion生成技术的框架,实现表情与姿态的迁移,HelloMeme集成空间编织注意力(Spatial Kn…
Depth Pro – 苹果推出2D图像生成3D深度图的开源模型
Depth Pro是什么 Depth Pro是苹果公司开发的一种先进的单目深度估计模型,能从单个2D图像快速生成高分辨率的3D深度图。模型不仅速度快,只需0.3秒,而且提…
FineVideo – Hugging Face推出的大型多模态视频数据集
FineVideo是什么 FineVideo是由Hugging Face推出的一个大型多模态视频数据集,专注于视频理解领域中的复杂任务,如情绪分析、故事叙述和媒体编辑。F…
OmniCorpus – 百亿级多模态数据集,支持中英双语
OmniCorpus是什么 OmniCorpus是一个大规模多模态数据集,包含86亿张图像和16960亿个文本标记,支持中英双语。由上海人工智能实验室联合多所知名高校及研…
OpenR – 伦敦大学联合多所高校推出提升大模型推理能力的框架
OpenR是什么 OpenR是一个由伦敦大学学院(UCL)、上海交通大学、利物浦大学、香港科技大学(广州)和西湖大学联合推出的一个开源框架,结合搜索、强化学习和过程监督提…
VoxInstruct – 清华推出的开源语音合成技术,支持多语言和跨语言合成
VoxInstruct是什么 VoxInstruct 是由清华大学开源的语音合成技术,能根据人类语言指令生成高度符合用户需求的语音。系统采用统一的多语言编解码器语言建模框…
IDIFY – 开源的在线AI证件照生成工具,本地浏览器自动处理图片
IDIFY是什么 IDIFY是一款免费开源的在线证件照生成工具,通过AI技术实现自动抠图,帮助用户快速生成符合标准的证件照。用户只需在浏览器中上传照片,选择尺寸和背景色,…
InvSR – 开源图像超分辨率模型,高清修复老旧照片
InvSR是什么 InvSR是创新的图像超分辨率模型,基于扩散模型的逆过程恢复高分辨率图像。用大型预训练扩散模型中丰富的图像先验,改善超分辨率的效果。InvSR的核心在于…
VideoLingo – 全自动AI视频翻译工具,一键搞定双语字幕和配音
VideoLingo是什么 VideoLingo 是一款一键全自动视频翻译工具,能将视频进行字幕切割、翻译、对齐和配音,最终生成 Netflix 级别的字幕和配音。Vid…
