Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: 英伟达开源PersonaPlex全双工语音AI模型:同时听和说,角色可定制,重新定义人机交互
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AI 工具 > 英伟达开源PersonaPlex全双工语音AI模型:同时听和说,角色可定制,重新定义人机交互
AI 工具AIGC 资讯

英伟达开源PersonaPlex全双工语音AI模型:同时听和说,角色可定制,重新定义人机交互

站外新闻
最近更新: 2026年6月7日 下午8:08
AIGC PersonaPlex 全双工AI 英伟达 语音大模型
SHARE

💡 站外导读:在当前的AI语音交互领域,多数系统仍受限于“一问一答”的延迟模式,难以模拟人类对话的流畅与自然。这种割裂感在客服、教育等实时场景中尤为突出,用户体验不佳。英伟达推出的PersonaPlex模型,正是为了破解这一核心痛点。它不仅实现了全双工通信——让AI能像人一样同时倾听和回应,更赋予了AI独特的“角色扮演”能力,预示着AI助手正从功能工具向具有个性和情境感知的交互伙伴进化。

PersonaPlex是什么

NVIDIA PersonaPlex 是英伟达推出的全双工对话AI模型,具备同时听和说的能力,能处理自然对话中的打断、停顿和回应。用户可通过语音和文本提示自定义角色和声音,让 AI 扮演从智慧助手到客服人员的多种角色。模型结合真实对话数据和合成数据进行训练,展现出色的对话自然性和任务遵循能力。PersonaPlex 在多种场景中表现出色,如教育、客服和紧急情况处理,为用户提供真正自然和人性化的交互体验。其中PersonaPlex-7B-v1模型现已开源,供开发者使用。

阅读目录
  • PersonaPlex是什么
  • PersonaPlex的主要功能
  • PersonaPlex的技术原理
  • PersonaPlex的项目地址
  • PersonaPlex的应用场景
      • 📝 站长洞察 (Editor’s Insight)

PersonaPlex

PersonaPlex的主要功能

  • 全双工对话能力:PersonaPlex能同时听和说,支持实时交互,自然处理对话中的打断、停顿和回应,使对话更加流畅和自然。
  • 角色和声音定制:用户可通过文本提示定义角色(如智慧助手、客服人员、虚构角色等),并通过语音提示选择不同的声音风格和语调,实现高度个性化的交互。
  • 自然对话行为:支持自然的对话节奏,包括打断、回应(如“嗯哼”、“好的”等)和适当的停顿,让对话感觉更像人类之间的交流。
  • 任务遵循能力:支持根据文本提示执行特定任务,如提供客户服务、解答问题或进行技术讨论,在对话中保持一致的角色表现。

PersonaPlex的技术原理

  • 全双工架构:PersonaPlex基于全双工模型,能同时处理用户的语音输入和生成语音输出,避免传统级联系统(ASR→LLM→TTS)的延迟。模型在用户说话的同时更新内部状态,能立即流式传输响应,实现低延迟交互。
  • 混合提示架构:
    • 语音提示:用音频嵌入(audio embedding)捕捉声音特征、说话风格和韵律。
    • 文本提示:通过自然语言描述角色、背景信息和对话上下文。
    • 联合处理:语音提示和文本提示联合处理,生成连贯的角色表现。
  • Transformer架构:Mimi语音编码器将音频转换为文本标记(tokens)。Temporal和Depth Transformer能处理对话内容和行为,如何时停顿、何时打断。Mimi语音解码器将文本标记转换为输出语音,支持24kHz的采样率。
  • 训练数据:模型用Fisher English语料库中的7303段真实对话(1217小时),通过GPT-OSS-120B生成角色描述。模型用语言模型生成对话脚本,通过Chatterbox TTS合成语音,覆盖多种场景和角色。将真实对话和合成对话结合训练,使模型能学习自然的语音模式和遵循任务要求。

PersonaPlex的项目地址

  • 项目官网:https://research.nvidia.com/labs/adlr/personaplex/
  • GitHub仓库:https://github.com/NVIDIA/personaplex
  • HuggingFace模型库:https://huggingface.co/nvidia/personaplex-7b-v1

PersonaPlex的应用场景

  • 教育领域:作为智慧教师,提供清晰且引人入胜的解答和建议,帮助学生更好地理解知识。
  • 客户服务:模型能扮演银行客服或医疗前台角色,根据文本提示处理客户问题,提供专业且富有同理心的服务。
  • 娱乐和社交:模拟各种虚构角色或进行开放式的闲聊,为用户提供有趣且个性化的社交体验。
  • 紧急情况应对:在模拟的太空任务等紧急场景中,用专业角色提供技术支持和紧急应对建议。
  • 医疗咨询:在医疗场景中协助记录患者信息,提供专业建议,支持医疗人员的日常工作。

📝 站长洞察 (Editor’s Insight)

PersonaPlex的发布,标志着AI语音交互从“功能响应”迈向“情境对话”的关键一跃。其全双工架构解决了长期存在的交互延迟问题,而基于混合提示的角色定制能力,则将AI应用推向了深度个性化的新高度。这不仅是技术的迭代,更是交互范式的革新。它预示着未来的AI界面将不再是冰冷的问答框,而是能够理解上下文、具备特定性格和专业背景的“数字生命体”。在AIGC应用日益追求沉浸感和拟人化的今天,PersonaPlex为虚拟助手、数字人乃至元宇宙社交奠定了关键的基础架构。英伟达此举,无疑是在抢占下一代人机交互标准的制高点。

Anthropic 免费推出 Claude for Teachers,助力美国教师智慧教学!
清华微软联手开源Kronos:全球首个金融K线图基础模型,预测精度碾压传统方法
Tarsier2 – 字节跳动推出的视觉理解大模型
Fish Speech 1.5 – Fish Audio 推出的语音合成模型,支持13种语言
VOGE
TAGGED:AIGCPersonaPlex全双工AI英伟达语音大模型
分享
Email 复制链接 打印
Share
上一篇 智谱开源GLM-4.7-Flash:300亿参数免费调用,编程中文写作翻译全面超越同类模型
下一篇 VerseCrafter:复旦腾讯联手开源,4D几何控制重塑动态视频生成新范式
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

MangaNinja – 基于参考图像的线稿着色技术

站外新闻
AIGC 资讯

OmniHuman – 字节跳动推出的单张照片生成全身动态视频生成框架

站外新闻
流光脑波AI大脑占位特色图
AIGC 资讯最新趋势

AI眼镜“iPhone时刻”逼近!2026年供应链追光逐芯,恒玄科技重押万亿新赛道

站外新闻
AI眼镜 MicroLED 恒玄科技 智能眼镜 智能穿戴
AIGC 资讯

VtripGPT – 视旅科技推出首个旅游领域的AI大模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.