Mini-LLaVA – 基于Llama 3.1的轻量级多模态大语言模型
Mini-LLaVA是什么 Mini-LLaVA是一款轻量级的多模态大语言模型,由清华大学和北京航空航天大学的研究团队联合开发。能处理图像、文本和视频输入,实现高效的多模…
TRELLIS – 微软联合清华和中科大推出的高质量 3D 生成模型
TRELLIS是什么 TRELLIS是清华大学、中国科学技术大学和微软研究院推出的3D生成模型,基于Structured LATent(SLAT)表示法,从文本或图像提示…
Wren AI – 开源文本驱动的SQL数据库查询解决方案
Wren AI是什么 Wren AI 是一个开源的文本到 SQL 解决方案,基于自然语言处理技术,支持用户通过自然语言提问执行数据库查询,无需编写复杂的 SQL 代码。支…
Sana – 英伟达、麻省和清华联合推出的文本到图像生成框架
Sana是什么 SANA是由NVIDIA、麻省理工学院和清华大学共同推出的文本到图像生成框架,能高效地生成高达4096×4096分辨率的高清晰度图像。SANA基于深度压缩…
MemoryScope – 为LLM聊天机器人配备的长期记忆系统
MemoryScope是什么 MemoryScope是一个为大型语言模型(LLM)聊天机器人设计的长期记忆系统。通过构建一个框架,使机器人记住用户的基础信息、习惯和偏好,…
悟界·RoboBrain Orca – 智源研究院推出的通用世界基础模型
悟界·RoboBrain Orca是什么 悟界·RoboBrain Orca 是智源研究院推出的多模态表征世界模型,以下一个状态预测替代传统下一个词/帧/动作预测,让 A…
Nemotron-Labs-Diffusion – 英伟达开源的三模式语言模型
Nemotron-Labs-Diffusion是什么 Nemotron-Labs-Diffusion 是 NVIDIA 推出的三模式语言模型,在单一架构内统一自回归、扩散…
MoWorld – 魔芯科技推出的全球首个高帧率交互式世界模型
MoWorld是什么 MoWorld 是魔芯科技推出的全球首个高帧率交互式世界模型,基于纯国产华为昇腾 NPU 全栈优化,实现最高 50 FPS 实时推理,成本较 GPU…
OpenAI高薪挖投行人才:年薪 139 万加股权,要用AI重塑华尔街
OpenAI正在加大对投资银行业务的布局力度,最新招聘信息显示,公司正在寻找拥有两年以上投资经验的投行专业人士,加入旧金山应用人工智能团队担任"主题专家"。该岗位基础年薪…
Podcastfy – AI文本转语音工具,支持多源文本转多种语言音频
Podcastfy是什么 Podcastfy 是一个开源的 Python 软件包,能将网络内容、PDF 文档及文本转换成多语言的音频对话形式。这款工具采用了先进的生成式人…
Chat2DB – AI数据库管理和分析工具,自然语言生成SQL
Chat2DB是什么 Chat2DB是一款AI驱动的数据库管理和AI数据分析工具,基于自然语言处理技术,支持用户用自然语言与数据库进行交互,简化SQL代码的编写和数据库管…
Gradio – 开源的Python库,快速创建机器学习模型的交互式网页
Gradio是什么 Gradio 是一个开源的 Python 库,简化机器学习模型的演示和共享过程。支持开发者基于简单的代码快速创建出友好的网页界面,任何人、任何地点能轻…
腾讯Hy3 编程评测出炉:参数只有对手五分之一,代码能力却与DeepSeek-V4-Pro打平
SuperCLUE放出腾讯Hy3 语言模型的编程专项测评数据,将其与DeepSeek-V4-Pro等热门模型同台比拼代码能力。Hy3 采用MoE架构,总参数规模295B,…
IterComp – 清北、牛津等多所高校联合推出的文本到图像生成框架
IterComp是什么 IterComp是一个由清华大学、北京大学、LibAI Lab、中国科学技术大学、牛津大学和普林斯顿大学的研究人员联合推出的文本到图像生成框架。基…
安全警报:Claude Code 被曝存在安全后门,官方已启动紧急修复
近日,工信部网络安全威胁和漏洞信息共享平台(NVDB)发布了一则重要的安全风险提示,指向目前编程界广泛使用的 AI 工具——Claude Code。据悉,该工具被发现内置…
淘宝闪购高管炮轰行业现状:电商App没有AI交互能力,用户的真实需求被”憋”住了
2026 中国互联网大会开幕,淘宝闪购高级副总裁、超算团队负责人郏夹发表主题演讲,直言当前电商和即时零售行业的一大痛点。他指出,绝大多数电商和即时零售App至今没有原生的…
