HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型
HyOCR-1.5是什么 HyOCR-1.5 是腾讯混元开源的轻量级端到端 OCR 专家大模型,仅 1B 参数能实现文档解析、文本识别、信息抽取、拍照翻译、图表解析、古文…
DreamPolish – 智谱AI、清华、北大联合推出的文本到3D生成模型
DreamPolish是什么 DreamPolish是智谱 AI、清华大学和北京大学推出的文本到3D生成模型,基于两阶段方法改进复杂对象的精细几何结构和高质量纹理的生成。…
OmniBooth – 华为诺亚方舟联合港科大推出的图像生成框架
OmniBooth是什么 OmniBooth是华为诺亚方舟实验室和港科大研究团队共同推出的图像生成框架,支持基于文本提示或图像参考进行空间控制和实例级定制。框架用用户定义…
DynaMem – 纽约大学和Hello Robot推出的动态空间语义记忆系统
DynaMem是什么 DynaMem是纽约大学和Hello Robot推出的动态空间语义记忆系统,专为开放世界中的移动操作设计。基于维护一个特征点云作为机器人记忆,处理环…
MVPaint – 腾讯PCG联合多所高校共同推出的3D纹理生成框架
MVPaint是什么 MVPaint是腾讯PCG 、上海AI LAB、南洋理工大学S-Lab、清华大学共同推出的3D纹理生成框架,基于同步多视角扩散技术实现高分辨率、无缝…
LTX Video – Lightricks推出的开源AI视频生成模型
LTX Video是什么 LTX Video是Lightricks推出的开源AI视频生成模型,能在4秒内生成5秒的高质量视频,速度超过观看速度。基于2亿参数的DiT架构,…
Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型
Agnes-2.5-Flash是什么 Agnes-2.5-Flash 是 Agnes AI 推出的新一代高性能文本模型,Coding 能力位列全球第一梯队,在代码理解、工…
BALROG – 基准测试工具,用于评估LLMs和VLMs在复杂动态环境中的推理能力
BALROG是什么 BALROG是评估大型语言模型(LLMs)和视觉语言模型(VLMs)在游戏上的推理能力,特别是模型在动态环境中的规划、空间推理和探索能力。基于一系列挑…
AutoVFX – 自然语言驱动的视频特效编辑框架
AutoVFX是什么 AutoVFX是先进的物理特效框架,是伊利诺伊大学香槟分校研究团队推出的,能根据自然语言指令自动创建真实感和动态的视觉特效(VFX)视频。框架集成神…
Markdown-to-Image – 开源的在线 Markdown 转海报编辑器
Markdown-to-Image是什么 Markdown-to-Image是开源的Markdown 转海报编辑器,作为React组件能将Markdown文本内容转换成图…
TÜLU 3 – Ai2 推出的系列开源指令遵循模型
TÜLU 3是什么 TÜLU 3是艾伦人工智能研究所(Ai2)推出的一系列开源指令遵循模型,包括8B和70B两个版本,未来计划推出405B版本。模型在性能上超越Llama…
微软全面引入AI挖掘Windows漏洞,后续安全补丁修复数量将大幅增加
微软Windows与设备部门执行副总裁Pavan Davuluri在博客发文透露,Windows团队正全面利用AI挖掘漏洞,后续Patch Tuesday安全更新将包含更…
SenseNova-Vision – 商汤开源的理解生成统一视觉大模型
SenseNova-Vision是什么 SenseNova-Vision 是商汤开源的理解生成统一视觉大模型,将目标检测、图像分割、深度预测、3D重建等经典视觉任务原生融…
EchoMimicV2 – 阿里推出的开源数字人项目,能生成完整数字人半身动画
EchoMimicV2是什么 EchoMimicV2是阿里蚂蚁集团推出的半身人体AI数字人项目,基于参考图片、音频剪辑和手部姿势序列生成高质量动画视频,确保音频内容与半身…
《智能体个人信息保护自律公约》正式发布,腾讯百度等31家企业首批签署
7月13日午间,在2026中国互联网大会“网民权益和个人信息保护论坛”上,《智能体个人信息保护自律公约》正式发布。腾讯、百度、美团、连尚集团等31家行业头部企业作为首批代…
米哈游AI陪伴软件《BSide: Olivia Lin》开启抢先体验,支持MIDI上传生成音乐视频
米哈游旗下AI陪伴互动软件《BSide: Olivia Lin》在Steam平台开启抢先体验。该应用需绑定米哈游通行证并支持与Steam账户关联,定位并非游戏,而是一款融…
