BAG – 港中文联合腾讯推出的3D可穿戴资产生成技术
BAG是什么 BAG(Body-Aligned 3D Wearable Asset Generation)是香港中文大学和腾讯联合提出创新的3D可穿戴资产生成技术,通过结…
SWE-Lancer – OpenAI 推出的大模型基准测试
SWE-Lancer是什么 SWE-Lancer 是 OpenAI 推出的大模型基准测试,评估前沿语言模型(LLMs)在自由职业软件工程任务中的表现。包含来自 Upwor…
TheoremExplainAgent – AI教学双智能体,数理化定理自动转动画
TheoremExplainAgent是什么 TheoremExplainAgent(TEA)是滑铁卢大学、Votee AI等机构开源的多模态代理系统,基于生成长篇动画视…
Kiln AI- 开源 AI 原型设计和数据集协作开发工具,微调专属模型
Kiln AI是什么 Kiln AI是开源的 AI 开发工具,能简化大型语言模型(LLM)的微调、合成数据生成和数据集协作。Kiln AI提供直观的桌面应用程序,支持 W…
FluxSR – 上海交大联合华为等高校推出的图像超分辨率模型
FluxSR是什么 FluxSR是新型的单步扩散模型,是上海交通大学、哈佛大学、华南理工大学和华为诺亚方舟实验室推出的专门用在真实世界图像超分辨率(Real-ISR)任务…
Avat3r – 慕尼黑大学联合 Meta 推出的 3D 高斯头像生成模型
Avat3r是什么 Avat3r 是慕尼黑工业大学和 Meta Reality Labs 推出的高保真三维头部头像的大型可动画高斯重建模型,仅需几张输入图像,能生成高质量…
TeleAI-t1-preview – 中国电信推出的复杂推理大模型
TeleAI-t1-preview是什么 TeleAI-t1-preview是中国电信人工智能研究院发布的“复杂推理大模型”,具备强大的逻辑推理与数学推导能力。通过强化学…
PSHuman – 开源的单图像3D人像重建技术,仅需一张照片
PSHuman是什么 PSHuman是先进的单图像3D人像重建技术。基于跨尺度多视图扩散模型,仅需一张照片,能生成高度逼真的3D人像模型,包括精细的面部表情和全身姿态。核…
MiniRAG – 港大推出高效部署小语言模型的新型 RAG 系统
MiniRAG是什么 MiniRAG是香港大学推出的新型检索增强型生成(RAG)系统,专为在资源受限的场景下高效部署小型语言模型(SLMs)设计。MiniRAG基于两个关…
StreamBridge – 苹果联合复旦推出的端侧视频大语言模型框架
StreamBridge是什么 StreamBridge 是苹果公司与复旦大学联合推出的端侧视频大语言模型(Video-LLMs)框架,能帮助 AI 实时理解直播流视频。…
DeepEP – DeepSeek 开源的专家并行通信库,专为 MoE 训练和推理设计
DeepEP是什么 DeepEP 是 DeepSeek 开源的首个专为混合专家模型(MoE)训练和推理设计的开源 EP(专家并行)通信库。提供了高吞吐量和低延迟的全对全 …
RAG Logger – 专为检索增强生成应用设计的开源日志工具
RAG Logger是什么 RAG Logger是开源的日志记录工具,专为检索增强生成(RAG)应用设计。作为LangSmith的轻量级替代品,专注于满足RAG应用的日志…
VideoRAG – 用于长视频理解的检索增强生成技术
VideoRAG是什么 VideoRAG是用于长视频理解的检索增强生成(Retrieval-Augmented Generation)技术。通过提取视频中的视觉对齐辅助文…
通古大模型 – 华南理工大学推出的古籍大语言模型
通古大模型是什么 通古大模型是华南理工大学深度学习与视觉计算实验室(SCUT-DLVCLab)推出的专注于古籍文言文处理的人工智能语言模型。基于百川2-7B-Base进行…
DynamicCity – 上海 AI Lab 推出的4D动态场景生成框架
DynamicCity是什么 DynamicCity 是上海AI Lab推出的大规模动态场景生成的4D生成框架。DynamicCity 专注于生成具有语义信息的动态 Li…
Aya Vision – Cohere 推出多模态、多语言的视觉模型
Aya Vision是什么 Aya Vision 是 Cohere 推出的多模态、多语言的视觉模型,提升全球范围内的多语言和多模态通信能力。支持 23 种语言,能执行图像…
