mPLUG-Owl3 – 阿里巴巴推出的通用多模态AI模型
mPLUG-Owl3是什么 mPLUG-Owl3是阿里巴巴推出的通用多模态AI模型,专为理解和处理多图及长视频设计。在保持准确性的同时,显著提升了推理效率,能在4秒内分析…
高考录取启动:千问接入EMS上线通知书实时追踪与提醒
7月9日消息,高考志愿录取结果即将揭晓,为了让用户更方便了解录取通知书寄送进度,千问高考接入中国邮政EMS,上线实时追踪与提醒功能。千问高考志愿日历会向每位高考用户推送“…
Kotaemon – 基于 RAG 技术的开源工具,聊天的方式快速检索文档信息
Kotaemon是什么 Kotaemon 是一款基于 RAG 技术的开源工具,支持用户通过自然语言与文档进行互动,快速检索和理解信息。适合需要处理大量文档的场合,如学术研…
MOFA-Video – 腾讯开源的可控性AI图生视频模型
MOFA-Video是什么 MOFA-Video是由腾讯AI实验室和东京大学的研究人员开源的一个可控性的图像生成视频的模型,该技术利用生成运动场适应器对图像进行动画处理以…
DiT – 基于Transfomer架构的扩散模型
DiT是什么 DiT(Diffusion Transformers)是一种新型的扩散模型,由William Peebles(Sora的研发负责人之一) 与纽约大学助理教授…
SCoRe – 谷歌DeepMind推出的多轮强化学习方法
SCoRe是什么 SCoRe(Self-Correction via Reinforcement Learning)是谷歌DeepMind推出的一种创新的多轮强化学习方法…
WeaveFox – 蚂蚁集团推出的 AI 应用创作平台
WeaveFox是什么 WeaveFox 是蚂蚁集团推出的 AI 应用创作平台,面向 OPC、个人开发者及非技术人员,通过自然语言对话可快速生成可部署的完整应用。平台集成…
DeepSeek-Prover-V1.5 – 70亿参数的开源数学大模型
DeepSeek-Prover-V1.5是什么 DeepSeek-Prover-V1.5是由DeepSeek团队开发的开源数学大模型,拥有70亿参数。模型通过结合强化学习…
RTranslator – 开源的离线、实时、多语言翻译应用程序
RTranslator是什么 RTranslator 是一款开源、免费、离线实时翻译应用程序,专为 Android 设备设计。基于先进的AI技术,包括 Meta 的 NL…
SleepFM – 斯坦福大学开源的多模态睡眠分析模型
SleepFM是什么 SleepFM 是斯坦福大学开源的多模态睡眠分析模型,基于超过14,000名参与者的100,000小时睡眠数据,通过融合大脑活动、心电图和呼吸信号,…
GPT-Live – OpenAI 推出的新一代语音模型
GPT-Live是什么 GPT-Live 是 OpenAI 推出的新一代语音模型,采用全双工架构实现同时听说,每秒多次决策开口、倾听、插话或调用工具。模型将实时交互与深度…
Champ – 基于3D的人物图片转视频动画模型
Champ是什么 Champ是由阿里巴巴、复旦大学和南京大学的研究人员共同提出的一种基于3D的将人物图片转换为视频动画的模型,该方法结合了3D参数化模型(特别是SMPL模…
Lingo – 西湖心辰推出的端到端语音大模型,媲美GPT-4o
Lingo是什么 Lingo 是西湖心辰推出的国内首个端到端语音大模型,在技术上具备实时打断、实时指令控制、超级拟人、能说会唱等能力,拥有比 GPT-4o 更出色的中文语…
Stable Diffusion整合包 – 秋葉发布的SD绘画本地部署解决方案
Stable Diffusion整合包是什么 Stable Diffusion整合包是B站UP主秋葉aaaki发布的SD绘画本地部署解决方案,包含了Stable Diff…
CriticGPT – OpenAI推出的识别GPT输出代码错误的模型
CriticGPT是什么 CriticGPT是OpenAI发布的一个新型人工智能模型,基于GPT-4构建,专门用于审查和识别大型语言模型(如ChatGPT)生成的代码中的…
VideoPoet – 谷歌推出的AI视频生成模型
VideoPoet是什么 VideoPoet是由谷歌的研究团队开发的一种基于大模型的AI视频生成方案,支持从文本、图像或视频输入中合成高质量的视频内容,并生成匹配的音频。…
