小米发布万亿参数旗舰Agent大模型MiMo-V2-Pro:性能逼近Claude Opus,价格仅1/5
💡 站外导读:随着AI Agent从概念走向生产力,行业呼唤能自主完成复杂任务的智能体。然而,顶尖Agent模型往往伴随着高昂成本与复杂配置,阻碍了技术普惠。小米最新发布…
MagicMirror – 开源的一键 AI 换脸、换发型和穿搭应用
MagicMirror是什么 MagicMirror是开源的AI换脸、换发型和穿搭应用,通过深度学习技术让用户能够一键变换形象。应用的特点简单易用、硬件友好、隐私保护和轻…
RLCM – 康奈尔大学推出的优化文本到图像一致性模型的框架
RLCM是什么 RLCM(Reinforcement Learning for Consistency Model)是康奈尔大学推出用在优化文本到图像生成模型的框架,基于…
百度千帆Qianfan-OCR震撼发布:4B参数端到端文档智能模型登顶权威评测,开源重塑OCR技术格局
💡 站外导读:传统OCR技术长期面临多阶段Pipeline的误差累积困境,文档解析需经过检测、识别、理解等多个独立模块串联,导致信息丢失与精度瓶颈。随着企业数字化转型加速…
PanoDreamer – 单张图像生成连贯360° 3D场景的新方法
PanoDreamer是什么 PanoDreamer是能够从单张图像生成连贯的360° 3D场景的新方法。这种方法不同于现有技术,它将问题构建为单图像全景和深度估计的两个…
LLM2LLM – 通过迭代数据增强提升大语言模型的技术
LLM2LLM是什么 LLM2LLM是创新的迭代数据增强策略,提升大型语言模型(LLM)在数据稀缺情况下的性能。方法通过基于一个强大的教师模型来生成合成数据,增强学生模型…
VideoMaker – 浙大联合腾讯和华为推出的零样本定制视频生成框架
VideoMaker是什么 VideoMaker是浙江大学、腾讯和华为诺亚方舟实验室共同开发的创新项目,基于视频扩散模型(VDM)的零样本定制视频生成框架。与传统方法不同…
CodeElo – 阿里 Qwen 团队推出评估 LLM 编程能力的基准测试
CodeElo是什么 CodeElo 是用于评估大型语言模型(LLMs)在编程竞赛级别代码生成能力的基准测试工具。通过与人类程序员的 Elo 评级系统进行比较,来衡量 L…
TITAN – 哈佛医学院研究推出的多模态全切片病理基础模型
TITAN是什么 TITAN是哈佛医学院研究团队开发的多模态全切片病理基础模型,通过视觉自监督学习和视觉-语言对齐预训练,能在无需微调或临床标签的情况下提取通用的切片表示…
FlexRAG – 中科院推出的高性能多模态 RAG 框架
FlexRAG是什么 FlexRAG 是创新的检索增强生成(RAG)框架,解决传统 RAG 系统在处理长上下文时面临的计算成本高和生成质量不足的问题。通过将检索到的上下文…
TANGOFLUX – 英伟达联合新加坡科技设计大学开源的文本到音频生成模型
TANGOFLUX是什么 TANGOFLUX是高效的文本到音频生成模型,是新加坡科技设计大学(SUTD)和NVIDIA共同推出的。模型拥有约5.15亿参数,能在单个A40…
GeneralDyG – 南洋理工推出的通用动态图异常检测方法
GeneralDyG是什么 GeneralDyG 是南洋理工大学研究团队提出的通用动态图异常检测方法,解决动态图数据在社交网络、电商和网络安全等领域的异常检测问题。通过时…
MMedAgent – 专为医疗领域设计的多模态AI智能体,管理多种医疗任务
MMedAgent是什么 MMedAgent是专为医疗领域设计的多模态AI智能体,通过整合各种开源医疗模型来管理多种医疗任务。系统包括一个指令调整的多模态大型语言模型(M…
