BrushEdit – 腾讯和北大等联合推出的图像编辑框架,指令引导图像编辑和修复
BrushEdit是什么 BrushEdit是腾讯、北京大学、香港中文大学及清华大学联合推出的先进图像编辑框架,是BrushNet模型的高级迭代版本。框架结合多模态大型语…
Clapper – 免费开源的可视化AI视频编辑工具
Clapper是什么 Clapper 是一款免费开源的可视化AI视频编辑工具,由 HuggingFace 的AI前端工程师 Julian Bilcke 开发。集成多种生成…
ScreenAI – 谷歌推出的可读屏AI视觉模型,可理解UI和信息图表
ScreenAI是什么 ScreenAI是一个由谷歌的研究人员推出的可读屏AI视觉语言模型,专门设计用于理解和处理用户界面(UI)和信息图表。该模型基于PaLI架构结合了…
PuLID – 字节跳动开源的个性化文本到图像生成框架
PuLID是什么 PuLID是由字节跳动的团队开源的一种个性化文本到图像生成技术,通过对比对齐和快速采样方法,实现了无需调整模型的高效ID定制,轻松实现图像换脸效果。该技…
AnyText – 阿里开源的视觉图像文字生成和编辑模型
AnyText是什么 AnyText是阿里巴巴智能计算研究院的团队推出的一个基于扩散的多语言视觉文本生成和编辑模型,专注于在图像中渲染准确和连贯的文本。AnyText包括…
Bocha Semantic Reranker – 博查推出的语义排序模型
Bocha Semantic Reranker是什么 Bocha Semantic Reranker是博查AI推出的语义排序模型,能提升搜索应用和RAG应用中的搜索结果准…
UniTalker – 商汤推出的音频驱动3D面部动画生成模型
UniTalker是什么 UniTalker是推出的音频驱动3D面部动画生成模型,能根据输入的音频生成逼真的面部动作。采用统一的多头架构模型,用带有不同标注的数据集,支持…
ResAdapter – 字节推出的扩散模型分辨率适配器
ResAdapter是什么 ResAdapter是由字节跳动的研究人员推出的一种为扩散模型(如Stable Diffusion)设计的分辨率适配器,允许这些图像生成模型生…
IC-Light – ControlNet作者开源的AI图片打光工具
IC-Light是什么 IC-Light是一款由ControlNet作者张吕敏开发的AI图像打光处理工具,可以对图片进行光源操纵和光影重构,实现与不同背景的完美融合。用户…
InstantID – 高保真的个性化图像合成框架
InstantID是一种基于扩散模型的图像生成技术,专注于实现零次(zero-shot)身份保留(Identity-Preserving)的个性化图像合成。该技术允许用户…
Ruyi – 图森未来推出的图生视频大模型
Ruyi是什么 Ruyi是图森未来推出的图生视频大模型,专为在消费级显卡上运行设计,支持多分辨率、多时长视频生成,具备首帧、首尾帧控制、运动幅度控制和镜头控制等特性。Ru…
Grok-2 – xAI公司推出的新一代AI模型
Grok-2是什么 Grok-2是xAI公司推出的新一代AI模型,提供卓越的聊天、编程和推理能力。在学术基准测试中,Grok-2在GPQA、MMLU、MMLU-Pro和M…
AtomoVideo – 阿里推出的高保真图像到视频生成框架
AtomoVideo是什么 AtomoVideo是由阿里巴巴的研究团队提出的一个高保真图像到视频(Image-to-Video, I2V)生成框架,旨在从输入的静态图像生…
AniTalker – 上海交大开源的对口型说话视频生成框架
AniTalker是什么 AniTalker是由来自上海交大X-LANCE实验室和思必驰AISpeech的研究人员推出的AI对口型说话视频生成框架,能够将单张静态人像和输…
VideoCrafter2 – 腾讯推出的高质量视频生成模型
VideoCrafter2 是什么? VideoCrafter2是一个由腾讯AI实验室开发的视频生成模型,旨在克服高质量视频数据获取的局限性,训练出能够生成高质量视频的模…
Large Action Models – 微软推出的行动大模型开发框架
Large Action Models是什么 Large Action Models(LAMs)是微软推出大型行动模型的开发框架,能执行真实世界行动的智能系统,LAMs超…
