月之暗面再度融资 20 亿美元,估值飙升至 300 亿
在人工智能领域的竞争愈发激烈之际,知名初创公司 “月之暗面”(Moonshot AI)正在积极寻求新一轮融资,目标金额高达 20 亿美元。这一融资计划若成功实施,将使其估…
Versatile-OCR-Program – 开源多模态OCR工具,精准提取复杂结构化数据
Versatile-OCR-Program是什么 Versatile-OCR-Program是开源多模态OCR工具,支持从复杂的教育材料中提取结构化数据,生成适合机器学习…
DiffBrush – 北邮联合清华等机构推出的图像生成与编辑框架
DiffBrush是什么 DiffBrush是北京邮电大学、清华大学、中国电信人工智能研究所和西北工业大学推出的,无需训练的图像生成与编辑框架,支持用户基于手绘草图直观地…
Motion Anything – 腾讯联合京东等高校推出的多模态运动生成框架
Motion Anything是什么 Motion Anything 是澳大利亚国立大学、悉尼大学、腾讯、麦吉尔大学、京东等机构推出的多模态运动生成框架,根据文本、音乐或…
OLMo 2 32B – Ai2 推出的最新开源语言模型
OLMo 2 32B是什么 OLMo 2 32B 是 Allen Institute for AI(Ai2)推出的最新开源语言模型,是 OLMo 2 系列的重要成果。拥有…
UniToken – 复旦联合美团等机构推出的统一视觉编码框架
UniToken是什么 UniToken 是新型的自回归生成模型,专为多模态理解与生成任务设计。通过结合离散和连续的视觉表示,构建了一种统一的视觉编码框架,能同时捕捉图像…
豆包·语音播客模型 – 火山引擎推出的语音播客模型
豆包·语音播客模型是什么 豆包·语音播客模型是字节跳动旗下火山引擎推出的语音播客模型。模型基于流式模型构建,可将文本秒级转化为双人对话式播客,具有低成本、高时效、强互动特…
OThink-MR1 – OPPO联合港科大推出的多模态语言模型优化框架
OThink-MR1是什么 OThink-MR1是OPPO研究院和香港科技大学(广州)联合推出的多模态语言模型优化框架。基于动态调整Kullback-Leibler(KL…
Baichuan-Audio – 百川智能开源的端到端语音交互模型
Baichuan-Audio是什么 Baichuan-Audio是百川智能推出的端到端音频大语言模型,支持无缝集成音频理解和生成功能,实现支持高质量、可控的实时中英双语对…
Qihoo-T2X – 360 AI 研究院和中山大学开源的高效多模态生成模型
QIHOO-T2X是什么 Qihoo-T2X 是360 AI 研究院和中山大学推出的基于代理标记化扩散 Transformer(PT-DiT)的高效多模态生成模型,Qih…
GigaTok – 港大联合字节推出用于自回归图像生成的视觉分词器
GigaTok是什么 GigaTok 是用于自回归图像生成的视觉分词器,参数量达 30 亿。通过语义正则化技术,将分词器特征与预训练视觉编码器(如 DINOv2)的语义特…
FlashMLA – DeepSeek 开源的高效 MLA 解码内核,专为Hopper 架构 GPU 设计
python setup.py install python tests/test_flash_mla.py from flash_mla import get_mla_…
Anus – Manus 生成的开源 AI 智能体项目,复刻 Manus 部分功能
# 安装Anus pip install anus-ai # 验证安装 anus --version # 安装所有可选功能 pip install anus-ai[all…
Magic 1-For-1 – 北大、英伟达等推出的高效视频生成模型
Magic 1-For-1是什么 Magic 1-For-1是北京大学、Hedra Inc. 和 Nvidia 推出的高效视频生成模型,基于优化内存消耗和推理延迟快速生成…
oli – 开源的终端AI编程助手,支持代码辅助与解释
oli是什么 oli 是开源的智能代码助手,支持为开发者提供强大的编程支持。基于现代化的混合架构,结合 Rust 后端的高性能和 React/Ink 前端的交互式终端界面…
Piece it Together – Bria AI等机构推出的图像生成框架
Piece it Together是什么 Piece it Together (PiT)是Bria AI等机构推出的创新图像生成框架,专门用在从部分视觉组件生成完整的概念…
