Void – 开源的AI辅助编程工具,代码自动补全和智能建议
Void是什么 Void 是基于 Visual Studio Code 构建的开源AI辅助编程工具,集成AI技术增强编程体验。Void支持代码自动补全、内联编辑、AI 驱…
EasyOCR – 支持超80种语言的开源OCR项目
EasyOCR是什么 EasyOCR 是一个功能强大的开源OCR(光学字符识别)项目,支持80多种语言和多种书写系统,包括中文、阿拉伯文和西里尔文。基于深度学习技术,提供…
Agent-S – 基于图形用户界面实现人机交互自动化的代理框架
Agent S是什么 Agent-S 是创新的代理框架,旨在基于图形用户界面(GUI)实现人机交互的自动化。Agent-S 基于模拟人类的操作方式,用鼠标和键盘直接与计算…
Pixtral 12B – Mistral AI推出的首款多模态AI模型
Pixtral 12B是什么 Pixtral 12B 是法国AI初创公司Mistral推出的首款多模态AI模型,能同时处理图像和文本。模型拥有 120 亿参数,模型大小约…
Emu3 – 北京智源推出的统一输入与生成多模态模型
Emu3是什么 Emu3是由北京智源人工智能研究院推出的一款原生多模态世界模型,采用智源自研的多模态自回归技术路径,在图像、视频、文字上联合训练,使模型具备原生多模态能力…
CLEAR – 新加坡国立大学推出的线性注意力机制,生成8K图像时提速6.3倍
CLEAR是什么 CLEAR是新加坡国立大学推出新型线性注意力机制,能提升预训练扩散变换器(DiTs)生成高分辨率图像的效率。基于将每个查询的注意力限制在局部窗口内,CL…
CatVTON – 中山大学和Pixocial联合推出的虚拟试衣技术
CatVTON是什么 CatVTON是一种先进的虚拟试衣技术,由中山大学和Pixocial联合推出。基于轻量化的架构和高效的训练策略,实现高质量的虚拟试衣效果。CatVT…
Draw an Audio – 中科院联合美团推出的视频生成音频系统
Draw an Audio是什么 Draw an Audio 是中国科学院自动化研究所和美团点评的研究人员推出的视频生成音频系统。根据视频内容自动生成匹配的声音效果,类似…
GPTEngineer – 文本驱动生成Web网页的开源工具,AI自动写代码
GPTEngineer是什么 GPTEngineer 是一个基于 AI 技术通过简单的文本提示快速生成网页应用原型的开源工具。用户只需描述需求,AI 能自动编写并执行代码…
Adobe Firefly – Adobe推出的系列创意生成式AI模型
Adobe Firefly是什么 Adobe Firefly 是 Adobe 推出的一系列创意生成式 AI 模型,旨在帮助用户扩展其天生的创造力。这些模型集成在 Adob…
MMRole – AI多模态角色扮演智能体(MRPA)框架
MMRole是什么 MMRole是中国人民大学高瓴人工智能学院研究团队推出的的一种多模态角色扮演智能体(MRPA)框架。通过结合图像和文本,使智能体以特定角色进行更自然和…
CCI 3.0 – 智源研究院发布的大规模的中文互联网语料库
CCI 3.0是什么 CCI 3.0是智源研究院发布的一个大规模的中文互联网语料库,包含了1000GB的数据集和498GB的高质量子集CCI 3.0-HQ。该版本在数据规…
DisPose – 北大等多所高校推出的增强人物图像控制动画质量的技术
DisPose是什么 DisPose是北京大学、中国科学技术大学、清华大学和香港科技大学的研究团队共同推出的,提高人物图像动画质量的控制技术,基于从骨骼姿态和参考图像中提…
ScribbleDiff – 开源的涂鸦内容转换成图像的生成技术
ScribbleDiff是什么 ScribbleDiff是一种先进的文本到图像生成技术,基于用户简单涂鸦的视觉提示指导图像的生成过程。通过分析涂鸦确保生成的图像中的对象方…
CogVideoX-5B-I2V – 智谱 AI 开源的图生视频生成模型
CogVideoX-5B-I2V是什么 CogVideoX-5B-I2V 是智谱 AI 开源的一款图生视频模型,通过一张图片和文本提示词生成视频。模型采用了3D 因果变分…
Augmented Physics – 将教科书静态图表生成交互式物理模拟的AI技术
Augmented Physics是什么 Augmented Physics是一个创新的教育工具,基于集成机器学习技术,将物理教科书中的静态图表转换成互动式和嵌入式的物理…
