Fish Agent – Fish Audio推出的端到端语音处理模型
Fish Agent是什么 Fish Agent是Fish Audio推出的创新的端到端语音处理模型,集成自动语音识别(ASR)和文本到语音(TTS)技术,无需传统的语义…
MeetingMind – AI会议助手,自动捕捉、分析和处理会议见解
MeetingMind是什么 MeetingMind是AI驱动的会议助手,基于录音和文件上传功能自动转录会议音频,从中提取关键信息,如任务、决策和问题,帮助用户轻松捕获和…
星辰大模型 – 中国电信推出的AI大模型集合平台
星辰大模型是什么 星辰大模型是中国电信推出的AI大模型集合平台,覆盖语义、视觉、语音等多模态领域。包含不同参数量级的模型,支持长文本处理,具备多语种语音识别和多任务视觉处…
Fast GraphRAG – 微软推出高效的知识图谱检索框架
Fast GraphRAG是什么 Fast GraphRAG 是微软推出的高效的知识图谱检索框架,旨在提供可解释性和高精度的代理驱动检索工作流。它结合了检索增强生成(RA…
Inkling – Thinking Machines Lab 推出的多模态基础模型
Inkling是什么 Inkling 是 Thinking Machines Lab 推出的开放权重多模态基础模型。模型原生支持文本、图像与音频输入,采用混合专家架构,在…
Stagehand – AI网页浏览框架,提供简单和可扩展的网页自动化解决方案
Stagehand是什么 Stagehand是简单和可扩展的AI网页浏览框架,是Playwright的继承者,提供act、extract和observe三个简单的API,…
VideoTuna – AI视频生成应用代码库,支持多模型和全面的视频生成流程
VideoTuna是什么 VideoTuna是集成多种AI视频生成模型的代码库,支持文本到视频、图像到视频和文本到图像的转换。VideoTuna提供预训练、持续训练、后训…
ComfyUI-MochiEdit – 开源的AI视频编辑工具,支持视频转视频和局部编辑
ComfyUI-MochiEdit是什么 ComfyUI-MochiEdit是基于ComfyUI和Genmo Mochi的开源视频编辑工具,基于将视频转换为噪声、重新采样…
Colibrì – 开源的轻量级本地推理引擎,分层存储推理
Colibrì是什么 Colibrì 是开源的轻量级本地推理引擎,能在 25GB 内存的消费级电脑上运行 744B 参数的 GLM-5.2 旗舰 MoE 模型。模型通过分…
HiCo – 360 AI研究院推出的布局可控AI绘画模型
HiCo是什么 HiCo是360 AI研究院推出的基于扩散模型的层次化可控布局到图像生成模型,HiCo基于多分支结构设计,实现对对象位置和文本描述的精确控制。HiCo的关…
Ferret-UI 2 – 苹果推出的跨平台UI理解多模态大语言模型
Ferret-UI 2是什么 Ferret-UI 2是苹果公司推出的多模态大型语言模型,用在理解和交互移动用户界面。Ferret-UI 2能识别和理解各种移动设备屏幕上的…
简历石沉大海?千问把写简历、做PPT、筛脏数据拆成了一套可复制的AI办公流水线
简历投出去石沉大海,写报告时盯着空白文档抓破头皮,拿到一张满是乱码的销售表不知从何下手——这些职场人的日常窒息瞬间,昨天在武汉被千问APP当面拆解了一遍。这场AI求职实战…
MMBench-Video – 上海AI Lab联合多所高校推出的长视频理解基准测试
MMBench-Video是什么 MMBench-Video是新颖的长视频多题问答基准测试,是浙江大学、上海人工智能实验室、上海交通大学和香港中文大学联合推出的。MMBe…
MiniMax发布Code2.0桌面端:底层架构全面重构,原生接入金融多源数据
7月16日,MiniMax正式发布MiniMax Code2.0桌面端。本次升级基于开源框架 Pi Agent 对底层架构进行了全面重构,重塑了会话运行、状态管理与工具调…
三钟的骗局:AI 语音诈骗如何轻松绕过防线
在美国佛罗里达州,73 岁的香农・布莱特威尔接到一个令人不安的电话,电话那头传来了她女儿哭泣的声音。那个声称是她女儿的声音告诉她,自己因驾车时发短信而撞到了孕妇,现在被警…
Kimi K3 模型预热视频流出,多段对比直指Claude Fable5 发起挑战
月之暗面于 7 月 15 日在B站、X平台及小红书等社交渠道发布预热视频,正式为Kimi K3 模型造势,新品有望在近期推出。在视频约 4 秒处一闪而过的数字"3",被外…
