VQAScore – CMU联合Meta推出的文本到视觉图像生成评估方法
VQAScore是什么 VQAScore是CMU和Meta联合推出的评估方法,基于视觉问答(VQA)模型衡量由文本提示生成的图像质量。VQAScore用计算模型对“Doe…
AndroidLab – 清华和北大联合推出系统化评估Android智能代理的框架
AndroidLab是什么 AndroidLab是用在训练和系统评估Android自主代理的框架,集成文本和图像模态操作环境,统一行动空间和可重现基准测试。Android…
Recraft V3 – Recraft推出的AI文本到图像生成模型
Recraft V3是什么 Recraft V3是Recraft公司推出的AI文本到图像生成模型,在Hugging Face的文本到图像模型排行榜上以1172的ELO评分…
Magentic-One – 微软推出的多AI智能体协同完成复杂任务系统
Magentic-One 是什么 Magentic-One 是微软推出的通用多智能体系统,解决跨领域的复杂网络和文件任务。系统基于多智能体架构,由Orchestrator…
X-Portrait 2 – 字节跳动推出的单图驱动视频生成模型
X-Portrait 2是什么 X-Portrait 2是字节跳动智能创作团队推出的单图视频驱动技术,基于一张静态照片和一段驱动视频生成高质量、电影级视频。X-Portr…
Ichigo – 开源的多模态AI语音助手,实时处理语音和文本的交织序列
Ichigo是什么 Ichigo是开源的多模态AI语音助手,采用混合模态模型,能实时处理语音和文本的交织序列。基于将语音直接量化为离散令牌,用统一的变换器架构同时处理语音…
CogSound – 智谱AI最新推出的音效模型
CogSound是什么 CogSound是智谱AI最新推出的音效模型,能为无声视频增添动人的音效。 基于GLM-4V的视频理解能力,CogSound能精准识别理解视频背后…
AgentSquare – 清华推出模块化智能体系统设计和搜索新框架
AgentSquare是什么 AgentSquare是清华大学团队推出自动在模块化设计空间中搜索大型语言模型代理。基于标准化的模块接口抽象,实现AI智能体的高速自我演化和…
Fashion-VDM – 谷歌和华盛顿大学联合推出的虚拟试穿技术
Fashion-VDM是什么 Fashion-VDM是谷歌和华盛顿大学共同推出的基于视频扩散模型(VDM)的虚拟试穿技术。能在给定服装图像和人物视频的情况下,生成人物穿着…
olly.bot – 个人AI助理,集成多种通用AI能力支持本地使用
olly.bot是什么 Olly.bot是集成于iMessage和SMS的个人AI助手,基于OpenAI大模型,提供网络搜索、文档分析、图片生成等功能。Olly.bot无…
AdaCache – Meta推出加速AI视频实时高质量生成的开源项目
AdaCache是什么 AdaCache(Adaptive Caching)是Meta推出的开源技术,能加速AI视频生成过程。AdaCache自适应缓存机制优化计算资源分…
CogVideoX v1.5 – 智谱最新开源的AI视频生成模型
CogVideoX v1.5是什么 CogVideoX v1.5是智谱最新开源的AI视频生成模型。模型包含CogVideoX v1.5-5B和CogVideoX v1.5…
MiLoRA – 上海财经、南方科技和清华大学联合推出针对LLMs的微调方法
MiLoRA是什么 MiLoRA是参数高效的大型语言模型(LLMs)微调方法,通过更新权重分量来矩阵的次要奇异减少计算和内存成本。方法基于奇异值分解(SVD)将权重矩阵分…
OpenCoder – 无限光年联合多所高校推出的开源代码大型语言模型
OpenCoder是什么 OpenCoder是墨尔本大学、复旦大学等高校研究人员联合无限光年推出的开源代码大型语言模型(LLM),能提升开源代码LLM的性能至专有模型水平…
Infinity-MM – 智源推出的千万级多模态指令数据集
Infinity-MM是什么 Infinity-MM是智源研究院推出的千万级多模态指令数据集,包含4300万条样本,数据量达10TB。数据集经过质量过滤和去重,确保高质量…
FabricDiffusion – 谷歌联合卡内基梅隆大学推出的高保真度3D服装生成技术
FabricDiffusion是什么 FabricDiffusion是谷歌和卡内基梅隆大学共同推出的高保真度3D服装生成技术,能将现实世界中2D服装图像的纹理和印花高质量…
