Depth Pro – 苹果推出2D图像生成3D深度图的开源模型
Depth Pro是什么 Depth Pro是苹果公司开发的一种先进的单目深度估计模型,能从单个2D图像快速生成高分辨率的3D深度图。模型不仅速度快,只需0.3秒,而且提…
FineVideo – Hugging Face推出的大型多模态视频数据集
FineVideo是什么 FineVideo是由Hugging Face推出的一个大型多模态视频数据集,专注于视频理解领域中的复杂任务,如情绪分析、故事叙述和媒体编辑。F…
OmniCorpus – 百亿级多模态数据集,支持中英双语
OmniCorpus是什么 OmniCorpus是一个大规模多模态数据集,包含86亿张图像和16960亿个文本标记,支持中英双语。由上海人工智能实验室联合多所知名高校及研…
OpenR – 伦敦大学联合多所高校推出提升大模型推理能力的框架
OpenR是什么 OpenR是一个由伦敦大学学院(UCL)、上海交通大学、利物浦大学、香港科技大学(广州)和西湖大学联合推出的一个开源框架,结合搜索、强化学习和过程监督提…
VoxInstruct – 清华推出的开源语音合成技术,支持多语言和跨语言合成
VoxInstruct是什么 VoxInstruct 是由清华大学开源的语音合成技术,能根据人类语言指令生成高度符合用户需求的语音。系统采用统一的多语言编解码器语言建模框…
IDIFY – 开源的在线AI证件照生成工具,本地浏览器自动处理图片
IDIFY是什么 IDIFY是一款免费开源的在线证件照生成工具,通过AI技术实现自动抠图,帮助用户快速生成符合标准的证件照。用户只需在浏览器中上传照片,选择尺寸和背景色,…
InvSR – 开源图像超分辨率模型,高清修复老旧照片
InvSR是什么 InvSR是创新的图像超分辨率模型,基于扩散模型的逆过程恢复高分辨率图像。用大型预训练扩散模型中丰富的图像先验,改善超分辨率的效果。InvSR的核心在于…
VideoLingo – 全自动AI视频翻译工具,一键搞定双语字幕和配音
VideoLingo是什么 VideoLingo 是一款一键全自动视频翻译工具,能将视频进行字幕切割、翻译、对齐和配音,最终生成 Netflix 级别的字幕和配音。Vid…
Void – 开源的AI辅助编程工具,代码自动补全和智能建议
Void是什么 Void 是基于 Visual Studio Code 构建的开源AI辅助编程工具,集成AI技术增强编程体验。Void支持代码自动补全、内联编辑、AI 驱…
EasyOCR – 支持超80种语言的开源OCR项目
EasyOCR是什么 EasyOCR 是一个功能强大的开源OCR(光学字符识别)项目,支持80多种语言和多种书写系统,包括中文、阿拉伯文和西里尔文。基于深度学习技术,提供…
Agent-S – 基于图形用户界面实现人机交互自动化的代理框架
Agent S是什么 Agent-S 是创新的代理框架,旨在基于图形用户界面(GUI)实现人机交互的自动化。Agent-S 基于模拟人类的操作方式,用鼠标和键盘直接与计算…
Pixtral 12B – Mistral AI推出的首款多模态AI模型
Pixtral 12B是什么 Pixtral 12B 是法国AI初创公司Mistral推出的首款多模态AI模型,能同时处理图像和文本。模型拥有 120 亿参数,模型大小约…
Emu3 – 北京智源推出的统一输入与生成多模态模型
Emu3是什么 Emu3是由北京智源人工智能研究院推出的一款原生多模态世界模型,采用智源自研的多模态自回归技术路径,在图像、视频、文字上联合训练,使模型具备原生多模态能力…
CLEAR – 新加坡国立大学推出的线性注意力机制,生成8K图像时提速6.3倍
CLEAR是什么 CLEAR是新加坡国立大学推出新型线性注意力机制,能提升预训练扩散变换器(DiTs)生成高分辨率图像的效率。基于将每个查询的注意力限制在局部窗口内,CL…
CatVTON – 中山大学和Pixocial联合推出的虚拟试衣技术
CatVTON是什么 CatVTON是一种先进的虚拟试衣技术,由中山大学和Pixocial联合推出。基于轻量化的架构和高效的训练策略,实现高质量的虚拟试衣效果。CatVT…
Draw an Audio – 中科院联合美团推出的视频生成音频系统
Draw an Audio是什么 Draw an Audio 是中国科学院自动化研究所和美团点评的研究人员推出的视频生成音频系统。根据视频内容自动生成匹配的声音效果,类似…
