上周二晚上翻 Gemini 3.8 Live 的发布稿。不是学习,值周。下个月客服那条语音线可能要换模型,我得提前知道会拿什么来压我。
翻到 τ-Voice-banking,35.1%。停了。
这一行没人念。
念的是 82.6、97.7、Speech Agent Arena 第二。语音到语音质量指数登顶,真本事。97 种语言、对话中自动切换,也是真本事。这些我不质疑。
可我们的评估表不看这个。我们只看三列:搞不定的比例、搞不定的时候掉到哪儿、掉下去那一秒客户听见什么。
把抄下来的摊桌上。
Artificial Analysis 语音到语音 82.6 总榜#1
Big Bench Audio 97.7%
τ-Voice 智能体任务完成率 68.6%
τ-Voice-banking 35.1%
Speech Agent Arena #2
上面三行是发布稿念的。下面两行是上线以后要见人的。同一份文档,两种读法。
35.1% 翻译成人话——银行那类任务,三次里两次搞不定。
剩下 64.9% 掉哪去?
发布稿不写。那不是模型的事,是你的事。
我第一反应是这模型不能上。后来想明白了,不是不能上,是上之前得先回答一个问题:掉下去那部分,落在谁头上。
演示挑的场景都是掉下去不疼的:入职指导、多步预订、草图变 React 组件。共同点不是简单,是搞砸了能重来,没人损失钱。
客服不一样。客户已经在电话那头了,孩子在旁边插话,听筒里开始念一段不对的东西。这个没有重来。
掉到哪去?掉到人。
转人工四个字听着像兜底,其实是把账从模型这边挪到排班表上。做预算那张表里,提效算的是模型跑通的那部分,转人工那部分从来不算——它不在 PPT 里,它在值班表里。所以那数永远好看:分母被砍了一半。
——补一刀:前年砍掉的那批客服,就是今年这 64.9% 要接的人。
这波跟文本 agent 有个真不一样的地方。文本模型想岔了,你屏幕是空的,它没开口,删掉重来。语音已经开始说话了。
Extended Thinking 那个「边推理边说话」——官方说得多好,多步后台任务推进过程中实时播报进展。你放到晚上想想:它一边推一边播,播错那句,已经进了客户耳朵,而且被录音了。
文本的错能删。语音的错是一个事件。
语言自动切换也一样。演示里漂亮,排障是另一个故事:客户先用中文说了需求,模型切英文回,客户跟着说英文,中间夹两句方言,最后我拿到一段工单,看不出他从哪一步开始觉得不对劲。回溯全靠猜。这个坑现在没人写,因为它只在出事以后才显形。
还有个没被念的工程细节。LiveKit、Pipecat、Vercel 那批平台在后台承担实时媒体流基础设施。翻译一下:媒体那层不归模型团队管,真丢包了也不归平台值班管,归你。
这种架构我熟。责任像击鼓传花,鼓一停,花落在离客户最近的那个人手里。这次那个人多半是个写业务逻辑的,从没想过自己哪天要跟丢包打交道。
说点我认的。后台执行工具调用、先确认用户请求再干活——我一开始当它花架子,觉得就是先说句「好的我看一下」盖延迟。后来改主意了。这跟 runbook 是一回事:不确定就先应一声,别闷着。凌晨三点最怕的不是报错,是没动静。它知道要先应一声,这点比我带过的几个新人都强。
但也就到这儿。
它知道要先应一声,不知道什么时候该挂电话。
SynthID 水印我也看到了。所有输出音频嵌不可感知水印,防虚假信息。挺好——防的是外面的人冒充我们,防不了我们自己的 agent 在客户耳朵边上胡说。后者才是排班表要考虑的。
顺带说 Workspace 那条线,Docs Live、Gmail Live、Keep Live,普通用户开箱就用。我们这边好歹还有评审、有个灰度、有回滚。他们那边没有。他们的「回滚」是撤销发送。
而语音没有撤销
