刚刚落幕的美加墨世界杯,腾讯云撑起了全球 17 个国家和地区的官方赛事直播,覆盖亚太及国内三分之二的官方授权平台。腾讯云副总裁、国际产品技术负责人李郁韬在近期采访中透露,这届世界杯 AI 第一次大规模进入直播生产,画质增强、智能导播、自动剪辑、智能横转竖、质检溯源在内的大部分环节,已经由 AI 全自动完成。一场世界杯的赛事支持,不过是 AIGC 开始迈入大规模生产应用的一个切面。

李郁韬把腾讯云要做的那层,称作多模态领域的 Harness(驾驭工程)——关注的不是模型怎么生成,而是从生成到稳定交付给用户之间,包括预处理、质检、拼接、转码、分发、格式适配在内的整条产业链路。

他观察到,在生成式 AI 的浪潮下,多媒体应用正面对多重挑战,尤其是直播、点播、媒体创作、多媒体互动这些场景,受限于网络传输、视频画质、用户体验以及各类特性的叠加,单一模型往往只能解决一部分问题。很多厂商看到新的多模态大模型,第一反应就是把它们全部对接一遍,今天接这家、明天出了新的再接那家;对接完一定会撞上这样那样的问题。如果每一家遇到的都差不多,从客户反馈里就能提炼出一个共性诉求:应该有人帮他们把底层全部做好,让他们更专注于业务创新和上层应用。如何识别用户需求、找到能解决需求的模型、修补模型天然的一些缺陷,再把最终的服务递给用户,这恰恰是作为音视频 PaaS 云服务厂商必须啃下的挑战。

早在 6 月 5 日的腾讯云 AI 产业应用大会上,腾讯云音视频就发布了 AI 品牌 Tencent Cloud WAND,构建起 6 大自研媒体专用模型与 60 余项 AI 能力,覆盖内容生成、理解、处理、编码全链路,专门为电商、短漫剧、教育、赛事直播等垂直场景训练。李郁韬说,团队会把所有模型串起来,不只大语言模型,也包括多模态模型,甚至那些小参数量的画质提升模型、小参数量的应用模型——他们去年就已经动手做多模态领域的 Harness,恰好今年生成式视频模型开始变多,行业内外对 Harness 的概念和理解也愈发趋同。

值得留意的是,视频生成被业内看作继 AI Coding 之后,第二个跑通商业闭环的 AI 变现场景。今年以来音视频大模型赛道竞争骤然加速,格局剧烈洗牌。国内厂商商业化进程凶猛,字节旗下 Seedance、快手可灵 AI 形成了 AI 视频生成赛道的”双寡头”。公开数据显示,今年 3 月可灵 AI 的 ARR 已逼近 5 亿美元,一年内增长 4 倍;另有媒体报道称,截至上半年 Seedance 2.0 的 ARR 已达 20 亿美元,字节方面虽辟谣称这一收入数据”偏高、与实际不符”,但也明确提及 Seedance 2.0 已跨过”生产力质变点”门槛。而海外,今年 3 月 OpenAI 宣布停止 Sora 的独立 App、API 接口及 ChatGPT 内置视频功能,退出了消费级 AI 视频生成市场。

做 To B 的产品和解决方案,生态合作被李郁韬摆在战略首位。他也坦言,团队内部一直在讨论一个问题:当从生成到交互之间的链路被不断压缩,Harness 这个生态位会不会被忽略甚至绕过?他的判断是,至少过去半年的观察下来不会,甚至 Harness 的重要性还会加强。如果把大模型当成后端的生产力,生产力的提升会显著刺激前端应用需求的增长,而且需求增长的广度会一直强于生产力的提升——大模型永远满足不了最终用户的极致需求,中间始终存在一个”供给关系差”,这正是 Harness 存在的必要性。

在他看来,腾讯云卡位多模态 Harness,最大的机会在于:很多音视频场景的体验都值得重新做一遍。第二个机会点则是,未来会有更多、更强、更全面的模型出来,怎么快速把这些模型应用到企业级的生产服务里,让最终用户感受到最新的大模型体验,正是多模态 Harness 要解决的问题,而不断把最新模型应用到客户最前端,整套生产流程和工具链条就显得格外重要。

自去年开始,整个 AI 算力已经开始从训练向推理倾斜,很多厂商构建推理算力的开销已经超过训练投入,这也意味着大量 AIGC 应用开始进入大规模生产应用。国内,短剧、漫剧制作是典型场景,目前已大量使用多模态技术做生产。在亚太地区,音视频解决方案是腾讯云出海的”排头兵”,在收入、市场份额、行业心智方面都居行业第一;最近五年,腾讯云把国际化作为重要战略方向,投入大量业务资源和基础设施在海外布局,公司披露近三年海外业务保持两位数增长。

腾讯云音视频总经理李志成则提到,无论是短剧、漫剧还是电商、工具类场景出海,最大的共性在于:前期客户可能关注效果、关注影响力,但中后期都很关注 ROI,也就是到底能不能盈利、能产生多少价值。现在被问得最多的,就是短剧、电商工具的使用,未来 1 到 2 年估计会慢慢普及,很多用户、企业都会用起来,就跟以前的大语言模型一样——两三年前更多是垂直行业在用,现在基本全普及了,成了大家工作中的一部分。

随着 Agent 时代到来,腾讯云前述能力还将与音视频智能体、AI 硬件、具身机器人、云手机结合,依托全球基建与边缘推理,支撑 AI 应用快速跑向全球、就近上线。李郁韬介绍,团队目前已与逐际等多家具身智能企业、无人清扫车企业开展合作,孵化出 TRRO 远程实时操控(远程数智人解决方案),用来解决弱网情况下机器人在人工介入时的低延时稳定通信、音视频数据回传等核心问题。

面向未来,李郁韬把云厂商在多模态领域的竞争归纳为三个方向。第一是多模态的训练和算力,不同于语言模型训练,多模态领域很大比例还投在理解和生成上,未来会有大量端到端的语音交互、端到端的视频生成,对算力的要求、对云厂商本身基建的投入都很大。第二是存储和数据积累,多媒体相对文字存储量要求更高,对存储稳定性、数据清洗和获取的要求也不一样,大量视频需要在预训练之前做数据清洗和处理,不同模态的数据要放在一起,训练前要做的处理都与文字类迥异。第三是应用生产端,云服务商提供更面向最终客户的推理服务、综合处理的应用能力,是影响客户选择的重要因素——创新趋势中产生的需求,怎么在运营端用很好的方式帮客户满足,这一点对腾讯云同样关键。