Reverb ASR – Rev公司开源的自动语音识别和说话人分离模型
Reverb ASR是什么 Reverb ASR是Rev公司推出的开源自动语音识别和说话人分离模型,基于20万小时的人工转录英语数据训练而成。模型在长语音识别领域表现卓越…
ItiNera – 港大与MIT联合推出的AI城市行程规划(OUIP)系统
ItiNera是什么 ItiNera 是港大和MIT联合开发的智能城市行程规划系统。基于大型语言模型(LLM)和空间优化技术,根据用户的个性化需求,如情侣酒吧、二次元圣地…
Marco – 阿里推出的商用翻译大模型,支持15个语种
Marco是什么 Marco是阿里国际最新推出的大规模商用翻译大模型,支持15种全球主流语种,包括中、英、日、韩、西、法等。在BLEU评测指标上超越Google翻译、De…
Seed-VC – 零样本实现声音克隆和转换的技术
Seed-VC是什么 Seed-VC 是一种零样本声音转换技术,基于上下文学习实现高质量的音频输出和音色相似度。用户无需进行特定训练,只需提供1到30秒的参考语音样本,实…
Midscene.js – AI驱动的 UI 自动化测试框架
Midscene.js是什么 Midscene.js是基于AI技术的自动化SDK,通过用大型语言模型(LLM)简化UI自动化测试中的命令。用户用自然语言描述交互步骤或预期…
Open NotebookLM – 开源的PDF转播客AI工具,能自定义语气
Open NotebookLM是什么 Open NotebookLM 是一个开源的AI工具,基于最新的开源AI模型,如Llama 3.1 405B、MeloTTS和Bar…
华知大模型5.0 – 知网联合华为云推出的多模态AI大模型
华知大模型5.0是什么 华知大模型5.0是同方知网与华为云联合推出的AI大模型,具备多模态理解和生成能力。华知大模型5.0的最大亮点在于多维模型的构建能力,涵盖从7B到1…
Ministral 3B/8B – Mistral AI推出的两款新型AI小模型
Ministral 3B/8B是什么 Ministral 3B和8B是由Mistral AI推出的两款新型AI小模型,专为设备端计算和边缘使用场景设计。在知识、常识、推理…
Phidias – 检索增强的3D内容生成模型,支持多模态输入
Phidias是什么 Phidias是一个先进的3D内容生成模型,将检索增强生成(RAG)的概念引入到3D建模领域。模型能基于用户提供的或从大型数据库中检索到的3D参考模…
ASAL – Sakana AI 联合 OpenAI 等推出使用基础模型搜索人工生命的系统
ASAL是什么 ASAL(Automated Search for Artificial Life)是用基础模型自动化搜索人工生命(ALife)的系统。ASAL是Saka…
StoryDiffusion – 生成一致性图像和视频序列的开源AI框架
StoryDiffusion是什么 StoryDiffusion是一个先进的AI图像和视频生成框架,用于从文本描述生成具有一致性的图像和视频序列。基于Consistent…
TANGO – 东京大学和CyberAgent AI Lab推出声音驱动全身手势视频生成框架
TANGO是什么 TANGO 是一个由东京大学和 CyberAgent AI Lab 共同推出的开源框架,专注于生成与目标语音同步的全身手势视频。基于分层音频运动嵌入和扩…
Movie Gen – Meta推出文本驱动的AI视频生成与编辑工具
Movie Gen是什么 Movie Gen 是 Meta 推出的AI视频生成工具,能根据文本提示生成和编辑视频,为视频配上同步音频。技术包括创建长达16秒的高清视频、为…
Browser Use – AI 浏览器助手,自动执行网页中的交互任务
Browser Use是什么 Browser Use是专门为大语言模型服务的智能浏览器工具,创新的Python工具库,让AI代理能像人类一样自然地浏览和操作网页。Brow…
Crawl4AI – 基于Python的异步爬虫框架,高效同时处理多个网页
Crawl4AI是什么 Crawl4AI是一款用 Python 开发的异步爬虫框架,专为大型语言模型(LLMs)和人工智能(AI)应用设计,简化网络爬虫和数据提取流程。基…
Nemotron-70B-Instruct – 英伟达推出的大语言模型
Nemotron-70B-Instruct 是什么 Nemotron-70B-Instruct 是英伟达(NVIDIA)推出的一个大型语言模型,基于一种新颖的混合训练方法…
