ScaleMCP – 普华永道推出的动态MCP工具检索器
ScaleMCP是什么 ScaleMCP是普华永道推出的工具选择方法,动态的为大型语言模型(LLM)Agents 配备Model Context Protocol(MCP…
GLM-4-Air-0414 – 智谱推出的基座模型
GLM-4-Air-0414是什么 GLM-4-Air-0414是智谱公司推出的拥有320亿参数的基座模型,是AutoGLM沉思背后的模型。GLM-4-Air-0414在…
R1-Onevision – 开源多模态视觉推理模型,基于 Qwen2.5-VL 微调
R1-Onevision是什么 R1-Onevision 是开源的多模态大语言模型,专注于复杂视觉推理任务。基于 Qwen2.5-VL 微调而成,通过整合视觉和文本数据,…
仿生手再升级!小米人形机器人亮相发布会,自主抓握手机拍照
小米于今日下午举办Xiaomi17T 系列手机新品发布会。发布会上,小米人形机器人惊艳亮相,现场演示了自主抓握 Xiaomi17T Pro 手机并操控音量键进行变焦拍照,…
unsloth – 开源的大语言模型微调工具
unsloth是什么 unsloth 是开源的大语言模型(LLM)微调工具,基于优化计算步骤和 GPU 内核,显著提升模型训练速度减少内存使用。Unsloth支持多种主流…
Codex CLI – OpenAI 开源的AI编程智能体
Codex CLI是什么 Codex CLI 是 OpenAI 推出的轻量级AI编程智能体。Codex CLI基于自然语言指令帮助开发者高效生成代码、执行文件操作和进行版…
Sitcom-Crafter – 北航联合港中文等高校推出的 3D 人类动作生成系统
Sitcom-Crafter是什么 Sitcom-Crafter 是北京航空航天大学、香港中文大学(深圳)、悉尼科技大学、中山大学等高校联合推出的 3D 场景中人类动作生…
IMAGPose – 南京理工大学推出姿态引导图像生成的统一框架
IMAGPose是什么 IMAGPose 是南京理工大学推出的用于人体姿态引导图像生成的统一条件框架。解决传统方法在姿态引导的人物图像生成中存在的局限性,如无法同时生成多…
ProtGPS – 麻省理工学院等机构推出的蛋白质语言模型
ProtGPS是什么 ProtGPS(Protein Localization Prediction Model)是麻省理工学院(MIT)和怀特黑德生物医学研究所推出的,…
Voila – 开源端到端语音大模型,实现低延迟语音对话
Voila是什么 Voila 是开源的端到端语音大模型,专为语音交互而设计。具备高保真、低延迟的实时流式音频处理能力,能直接处理语音输入并生成语音输出,为用户提供流畅且自…
Gemini 2.5 Pro – 谷歌推出的最新 AI 思考模型
Gemini 2.5 Pro是什么 Gemini 2.5 Pro 是谷歌推出的最新 AI 模型,是一个“思考模型”,能在回应前进行推理,提升性能和准确性。模型在多个基准测…
MoMask – 文本驱动生成高质量3D人体动作的模型
MoMask是什么 MoMask是创新的3D人体动作生成工具,通过生成式掩码建模技术,能根据文本描述生成高质量的3D人体动作。MoMask采用分层量化方案,将人体运动表示…
Lipsync-2 – Sync Labs 推出的首个零-shot 嘴型同步模型
Lipsync-2是什么 Lipsync-2 是 Sync Labs 推出的全球首个零-shot 嘴型同步模型。无需针对特定演讲者进行预训练,能即时学习并生成符合独特说话…
SpeciesNet – Google 开源的动物物种识别 AI 模型
SpeciesNet是什么 SpeciesNet 是 Google 开源的人工智能模型,通过分析相机陷阱拍摄的照片来识别动物物种。基于超过 6500 万张图像训练而成,能…
快看漫画启动“数字生命”战略,AI新品Livo拟于7月公测
在近日举办的2026腾讯AI产业应用大会AI新视听专场上,快看漫画宣布正在研发AI数字生命产品“Livo”,预计将于今年7月正式启动公测。据透露,该产品由快看漫画创始人陈…
DiffSplat – 北大联合字节推出的 3D 生成框架
DiffSplat是什么 DiffSplat是新型的 3D 生成方法,从文本提示和单视图图像快速生成 3D 高斯点阵(Gaussian Splats)。通过微调预训练的文…
