Llasa TTS – 香港科技大学开源的文本转语音模型
Llasa TTS是什么 Llasa TTS 是香港科技大学基于 LLaMA 架构推出的开源文本转语音(TTS)模型,支持高质量语音合成和克隆。Llasa TTS 基于单…
Gemini 2.0 Flash – Google推出的多模态 AI 模型
pip install google-genai from google import genai from google.genai import types # 初始…
Absolute Zero – 清华大学等机构推出的语言模型推理训练方法
Absolute Zero是什么 Absolute Zero是清华大学 LeapLab 团队联合北京通用人工智能研究院 NLCo 实验室和宾夕法尼亚州立大学推出的全新语言…
BizGen – 清华大学联合微软推出的AI信息图生成工具
BizGen是什么 BizGen是清华大学和微软研究院联合推出的AI信息图生成工具,专注于文章级别的视觉文本渲染。能一键将长篇文章内容转化为专业级的信息图和幻灯片,解决传…
拒绝数据被偷!ChatGPT紧急上线“封锁模式”,宁可断网也要保安全
为了降低敏感数据被恶意窃取的风险,OpenAI 近日面向所有已登录用户推出了一项名为“封锁模式”的可选新安全设置。该模式涵盖了不同的账户类型以及工作区,用户和管理员可以自…
工作流迈向工程化!国内开源 AI 智能体 Runtime 框架 MateClaw 发布 v1.5.0 重磅更新
近日,开源 AI 智能体(Agent)Runtime 框架MateClaw 正式发布了 v1.5.0版本。本次迭代并未盲目追求模型接入的数量,而是将重心放在了补齐 Age…
日日新SenseNova V6 – 商汤推出的多模态融合模型系列
日日新SenseNova V6是什么 日日新SenseNova V6是商汤推出的日日新第六代多模态融合大模型系列,基于6000亿参数的多模态MoE架构,实现文本、图像和视…
能力与安全的博弈!OpenAI 上线 ChatGPT“封锁模式”,宁可断网也要防数据泄露
在生成式人工智能向智能体(Agent)时代全速演进的过程中,越发强大的工具调用和联网能力,也让安全防御的系统防线面临着前所未有的考验。为了应对日益猖獗的提示注入攻击,Op…
Kiss3DGen – 基于图像扩散模型的3D资产生成框架
Kiss3DGen是什么 Kiss3DGen是创新的3D资产生成框架,通过重新基于预训练的2D图像扩散模型来高效生成、编辑和增强3D对象。核心在于生成“3D Bundle…
OpenCV 5 重磅发布:全新 DNN 引擎原生支持大模型,迈入大模型时代
作为全球计算机视觉与人工智能领域的基石,开源视觉库 OpenCV 正式迎来了里程碑式的重大升级。本周,OpenCV 团队正式对外发布了全新的OpenCV5,在延续其二十多…
o1-pro – OpenAI 推出的升级版推理模型
o1-pro是什么 o1-pro是 OpenAI 正式推出的 o1 系列的升级版本,o1-pro 是目前 OpenAI 最强大的推理模型,核心优势在于显著提升的计算能力,…
ChatDLM – Qafind Labs推出的全球最快扩散语言模型
ChatDLM是什么 ChatDLM是 Qafind Labs推出的全球最快扩散语言模型,核心定位是突破传统Transformer架构在长上下文处理与推理效率上的瓶颈。模…
II-Agent – Intelligent Internet开源的通用AI Agent框架
II-Agent是什么 II-Agent 是开源的Agent框架,通过与大型语言模型(LLM)的交互,简化和提升跨多个领域的工作流程。具备多种核心功能,包括研究与事实核查…
WorldScore – 斯坦福大学推出的世界生成模型统一评估基准
WorldScore是什么 WorldScore 是斯坦福大学提出的用于世界生成模型的统一评估基准。将世界生成分解为一系列的下一个场景生成任务,通过明确的基于相机轨迹的布…
LDGen – 理想汽车推出的多语言文本到图像生成技术
LDGen是什么 LDGen是创新的文本到图像合成技术,通过结合大型语言模型(LLMs)与扩散模型,提升文本描述到图像生成的质量和语义一致性。通过分层标题优化和人类指令技…
听听乱码就被“洗劫”?谷歌 Gemini 语音助理爆潜伏漏洞,黑客用特殊通知给 AI “下毒”
智能家居与语音助手正成为黑客眼中的“新猎物”。网络安全公司 SafeBreach 日前公开披露,谷歌旗下的智能语音助理Gemini存在一个极其隐蔽的新型安全漏洞。黑客可以…
