DynamicFace – 小红书联合上海交大等推出的视频换脸技术
DynamicFace是什么 DynamicFace是小红书团队推出新型的视频换脸技术,技术通过结合扩散模型和即插即用的时间层,基于3D面部先验知识,实现高质量和一致性的…
Whisper Input – 开源AI语音输入工具,支持多语言实时转录和翻译
Whisper Input是什么 Whisper Input 是开源的语音输入工具,基于 Python 和 OpenAI 的 Whisper 模型开发。通过简单的快捷键操…
AnyStory – 阿里通义推出的高保真个性化文本到图像生成框架
AnyStory是什么 AnyStory是阿里巴巴通义实验室研发的创新文本到图像生成框架,实现单个和多个主体的高保真个性化图像生成。通过“编码-路由”的方法来建模主体个性…
Nemotron-CC – 英伟达推出的大型预训练数据集
Nemotron-CC是什么 Nemotron-CC是NVIDIA团队推出的大型预训练数据集,能将Common Crawl数据转化为适用于长序列预训练的高质量语料。Nem…
HealthBench – OpenAI推出的开源医疗测试基准
HealthBench是什么 HealthBench是OpenAI推出的开源医疗测试基准,用在评估大型语言模型(LLMs)在医疗保健领域的表现和安全性。HealthBen…
VideoVAE+ – 香港科技大学推出的先进跨模态视频变分自编码器
VideoVAE+是什么 VideoVAE+(VideoVAE Plus)是香港科技大学团队推出的先进的跨模态视频变分自编码器(Video VAE),通过引入新的时空分离…
JoyCaption – 开源的图像提示词生成工具
JoyCaption是什么 JoyCaption 是开源的图像提示词生成工具,用于训练扩散模型。JoyCaption 涵盖广泛的图像风格、内容、种族、性别和取向,最小化过…
Social Media Agent – AI社交媒体内容管理工具,输入URL自动生成帖子
Social Media Agent是什么 Social Media Agent是智能的社交媒体内容管理工具,能帮用户收集、整理和安排发布社交媒体帖子,基于输入的URL内…
Agentic Reasoning – 牛津大学推出增强LLM推理能力的框架
Agentic Reasoning是什么 Agentic Reasoning是牛津大学推出的增强大型语言模型(LLM)推理能力的框架。基于整合外部工具(如网络搜索、代码执…
FireRedASR – 小红书开源的自动语音识别模型
FireRedASR是什么 FireRedASR 是小红书开源的工业级自动语音识别(ASR)模型家族,支持普通话、中文方言和英语,在普通话 ASR 基准测试中达到了新的最…
Gemini 2.0 Pro – 谷歌推出的高性能多模态AI模型
Gemini 2.0 Pro是什么 Gemini 2.0 Pro是Google推出的高性能实验版AI模型,专为编程性能和复杂提示处理优化。Gemini 2.0 Pro具备…
Fast3R – Meta 联合密歇根大学推出的多视图3D重建方法
Fast3R是什么 Fast3R是Meta和密歇根大学的研究人员提出的新型的多视图3D重建方法,基于Transformer架构,能在一个前向传播过程中处理1000多张图像…
SHMT – 阿里达摩院联合武汉理工等机构推出的自监督化妆转移技术
SHMT是什么 SHMT(Self-supervised Hierarchical Makeup Transfer)是阿里巴巴达摩院与武汉理工大学等机构联合研发的先进自监…
NVIDIA-Ingest – 英伟达开源的智能文档提取及结构化工具
NVIDIA-Ingest是什么 NVIDIA-Ingest是英伟达开源的用于解析复杂、混乱的非结构化PDF和其他企业文档的微服务集合。NVIDIA-Ingest能将文档…
Seedance 1.0 lite – 火山引擎推出的视频生成模型
Seedance 1.0 lite是什么 Seedance 1.0 lite是火山引擎推出的豆包视频生成模型的小参数量版本,支持文生视频和图生视频两种生成方式,支持生成5…
memobase – 基于用户画像的长期记忆系统
memobase是什么 memobase 是开源的基于用户画像的长期记忆系统,专为生成式人工智能应用设计。memobase能为虚拟助手、教育工具等应用提供用户记忆功能,帮…
