售前·高阶版:总耗时超过 30 秒的会话,慢在哪

窗口 08-01 至 08-06(6 天)· 全自动与辅助模式两种接待模式全量口径 · 极值会话 9 条逐段还原 + 段级抽样 355 条交叉校验

口径:高阶版 买家级分桶归属 已在数据层剔除闲置、拍卖、酒旅三个行业,保留 18 个行业白名单 深挖抽样仅取全自动接待
给管理层的摘要

问题有多大:6 天里有 31,192 轮买家等了 30 秒以上,每 23 轮就有 1 轮;逐日占比已从 5.73% 收敛到 2.22%,但剩下的部分高度集中——大家电一个行业占六成、两家店占近一半

根因是什么:耗时超 30 秒,主要慢在 agent 主体(占 98%)。核心是「反思复核 → 重新知识检索或调用工具 → 重写」这个循环被反复触发,比正常会话多等约 22 秒。不是单次变慢,是循环过多——超时组超 58.33% 的轮次调了 3 次以上大模型,未超时组(30s 内)只有 6.67%。

怎么解决、收益多少:四条动作——反思触发的重写限 1 次并对反思限时、Loop 轮数随对话深度递减、同工具调用去重、按行业分组配链路(含大家电两店专项)。按 240 条抽样模拟测算,前三条链路动作做完,慢组有 23.33%(保守)~64.17%(积极)的轮次可压回 30 秒以内,超 30 秒占比预计从 4.30% 降到 3.30%(保守)~1.54%(积极),测算口径见第五章收益一览。

总体占比
31,192·4.30%
每 23 轮就有 1 轮,买家等过 30 秒
分母:全部 725,062 轮
行业分布
18,870·60.50%
大家电一个行业占掉六成
该行业自身 8.86%,是第二名的近 2 倍
重点商家分布
14,349·46.00%
两家大家电店就占近一半,前 30 店占 87.91%
前 3 店合计 51.17%,可做单店专项
全自动占比
22,808·4.70%
40 秒以上的全部落在全自动侧
分母:全自动 485,492 轮
辅助模式占比
8,384·3.50%
辅助模式没有一轮超过 40 秒
最长 37,574 毫秒;分母 239,570 轮

超过 30 秒的会话平均等待 34,454.3 毫秒,单轮最长 60,745 毫秒。行业与商家两张卡是「谁贡献了这些轮次」的口径(分母是全体超 30 秒),两张接待模式卡是「这种模式自己有多容易超」的口径(分母是该模式总轮次),两类占比不能相加。

行业范围:本次剔除闲置、拍卖、酒旅三个行业,保留 18 个行业白名单,实际有数据 15 个。剔除动作在数据层重新聚合后重跑,而非在展示层把行隐藏——所有占比、均值、分母都按剔除后的样本重算。

一、四个澄清

超 30S 的 RT 已收敛

逐日从 5.73% 降到 2.22%,六天单调下行、没有一天反弹,说明前期的反思限时动作确实在生效。分行业看则没有这么干净:文教香氛 08-04 到 08-05 从 3.98% 回到 4.82%、快消从 3.05% 回到 3.79%,当天有小幅反复;汽车流量从 387 轮涨到 2,679 轮(近 7 倍),比例在 0.45% 到 2.22% 之间摆动,属于正在放量的新行业,需要单独观察。

0% 2% 4% 6% 5.73% 5.52% 4.99% 3.84% 3.47% 2.22% 08-0108-02 08-0308-04 08-0508-06 当日总轮次 当日超 30 秒占比 6 天累计下降 61%

图中灰柱为当日总轮次(11.7 万至 12.6 万轮,8 月 4 日达峰后小幅回落),蓝色折线为当日超 30 秒占比,含全部接待模式。六天里占比一路单调下行、中间没有一天反弹。

不是超时报错

超 30 秒组和 30 秒以内组的异常发生率都是 0。时长分布也不像被掐断:30–40 秒占 87.97%,60 秒以上只有 3 轮,最长 60,745 毫秒。

这些会话是正常跑完的,只是跑得久。

不是图片和多模态

超 30 秒的 22,808 轮里,非文字输入只有 2 轮(都是点击卡片)。图片识别环节虽然在慢组里超 1 秒的比例更高(4.16% 对 1.92%),但它的均值只有 109 毫秒。

这是一个极小的子群,不是主因。

不是某个节点变慢

34 个有名字的识别与后处理节点,在一轮超 30 秒的会话里加起来只有 1,259.2 毫秒,只解释 3.54%。增量最大的商品识别节点也只多了 52.7 毫秒。

换句话说,节点级优化这条路,天花板不到一秒。

不是最近才出现的问题

上面那条曲线不是靠流量摊薄出来的:按店铺分层看,头部 3 家店从 11.09% 降到 5.76%,其余店从 4.32% 降到 1.80%,两侧同时改善,末日大盘 2.22%。

诚实标注:头部 3 店流量同期从 23,013 轮降到 16,533 轮,其余店从 52,646 轮涨到 64,367 轮,所以大盘那条下降曲线里既有真实改善,也有流量结构位移,两者不能混算。

二、慢在哪:98% 的落在售前主agent这一段

把一轮的总耗时拆成三段——前置识别(认商品、认订单、判断要不要转人工)、售前主agent(找知识、想答案、写答案)、回复后处理(分场景、贴卡片、发出去)。三段相加等于总耗时。

分段归因

一轮多出来的 21.5 秒,97.96% 落在售前主agent这一段——找知识、想答案、写答案。前置识别只多了 203.7 毫秒,回复后处理只多了 60.6 毫秒,两段加起来占增量不到 1.25%。也就是说,能优化的地方只有一处。

分段超30秒组均值30秒以内组均值差值倍数占总增量
一轮总耗时35,568.2 ms14,026.1 ms+21,542.1 ms2.54×100%
售前主agent34,024.4 ms12,921.9 ms+21,102.5 ms2.63×97.96%
前置识别1,003.2 ms799.5 ms+203.7 ms1.25×0.95%
回复后处理276.0 ms215.4 ms+60.6 ms1.28×0.28%

多出来的 21.5 秒,钱花在哪

售前主agent 97.96%

橙 0.95% 前置识别 · 蓝 0.28% 回复后处理 · 灰 0.81% 段间调度。售前主agent本身占一轮的 95.66%,且在耗时明细里没有内部拆分,要再往下看只能逐条还原会话日志——下面就是这么做的。

越往后聊越慢,单调上升没有拐点

对话深度

从首轮的 1.82% 到 16 轮以上的 17.31%,翻了 9.5 倍,中间没有任何一档回落。超 30 秒的会话平均已经聊到第 4.88 轮,30 秒以内的只到第 3.02 轮。这条曲线是后面所有动作建议的基础:慢不是随机发生的,是随着对话变深必然发生的。尾部更直观:聊到第 9 轮以后,最慢的 10% 轮次等待已越过 30 秒线(P90 30,126 毫秒);即便是首轮,最慢的 1% 也要等 32 秒以上。

对话进行到第几轮总轮次超30秒轮次超30秒比例该档平均耗时P90 耗时P95 耗时P99 耗时
第 1 轮164,8372,9991.82%9,871 ms20,033 ms23,513 ms32,113 ms
第 2 轮115,0384,9594.31%16,521 ms24,116 ms28,085 ms36,773 ms
第 3–4 轮113,1866,5525.79%17,687 ms25,913 ms29,996 ms38,936 ms
第 5–8 轮66,3025,0007.54%18,592 ms27,349 ms31,398 ms40,679 ms
第 9–15 轮21,5422,50211.61%20,244 ms30,126 ms34,416 ms45,018 ms
第 16 轮以上4,59979617.31%22,347 ms32,670 ms37,073 ms47,705 ms

P90/P95/P99 的意思:把该档所有轮次按耗时从快到慢排队,排在 90%、95%、99% 位置那一轮的等待时长——P99 可读作「最慢的 1% 买家至少等了这么久」。分位数需要逐条明细计算,明细日志只保留最近 7 天,计算时 08-01 已过期、08-02 不完整,故这三列按 08-03 至 08-06 四天完整数据计算;同口径下四天各档平均耗时比表内六天口径低 2.47%~3.13%(后几天整体在变快),分位数读数因此可能略偏低,档间对比结论不受影响。

而且慢的都是真问题,不是打招呼

诉求类型

寒暄类在慢组里只占 10.37%,在快组里占 37.24%——快的那一半有三分之一根本不用想答案。而活动咨询是最慢的场景(36,284 毫秒),并且它在慢组里的占比(19.56%)是快组(9.48%)的两倍多,说明活动规则这类知识最容易把机器人拖进长时间思考。

买家在问什么超30秒轮次占慢组慢组均值占30秒以内组该组均值
商品咨询13,08657.37%35,442 ms44.40%16,646 ms
活动咨询4,46119.56%36,284 ms9.48%17,291 ms
未识别出诉求(多为寒暄)2,36610.37%35,013 ms37.24%9,350 ms
商品推荐1,7207.54%35,660 ms4.25%17,368 ms
售后问题4942.17%35,786 ms0.88%19,011 ms
售前物流3821.67%34,495 ms2.36%16,338 ms
购买操作2881.26%35,289 ms1.34%15,950 ms
发货物流110.05%35,119 ms0.05%18,172 ms

买家等最久的,恰恰是机器人最后没自己答上来的那些

答案来源

等 37.49 秒换来一句兜底知识库agent的回复、等 37.65 秒最后还是转人工,都比机器人自己答完(35.37 秒)更慢。买家付出了最长的等待,拿到的却是最差的结果,这是双重损失。

这一轮最后谁给出的答案超30秒轮次慢组均值30秒以内轮次该组均值倍数
售前主agent自己答的19,79935,373 ms423,40214,085 ms2.51×
兜底知识库agent回复1,09437,491 ms4,23413,158 ms2.85×
最后还是转了人工99237,650 ms27,79211,763 ms3.20×
转交售后agent92335,243 ms7,26819,771 ms1.78×

换独立字段交叉验证结论一致:兜底知识库agent的命中率,慢组 5.94%(1,354 轮)对快组 1.11%(5,135 轮),差 5.3 倍。这个字段与上表的答案来源字段各自独立记录,两边都指向同一件事——答不上来的那部分,恰好也是等得最久的那部分。

逐条还原:9 条最慢会话,存在 2 类典型问题

每个行业取最慢 1 条、共 9 条(38.5–53.6 秒),全部是全自动接待的纯售前会话,把日志里的子流程按真实起止时刻重排成时间轴。

极值会话

9 条会话逐条拆开后,慢的原因只有 2 类:一类是答案早就写好了,卡在反思;另一类是一句话 Loop 好几轮才写完。两类都不是环节变慢,而是同一段里被反复执行。

类型 A:答案早就写好了,卡在反思(4 条)

平均主体 46.8 秒。第一版答案平均在第 17.3 秒就已经产出,之后的反思花 12.9–19.8 秒,判定不合格再重写一遍又花 6.8–17.7 秒,买家为此又多等了 29.4 秒。反思加重写合计 27.4 秒,等于主体的 58.60%。

类型 B:一句话 Loop 好几轮才写完(5 条)

平均主体 42.6 秒,没有反思环节,纯粹是生成轮数多。生成合计占主体的 65%–90%,最极端的汽车那条 48.3 秒、占 90.40%。第 1 轮平均 4,486 毫秒,第 2 轮就跳到 12,149 毫秒,第 3 轮 10,415 毫秒,第 4 轮 9,953 毫秒——第 2 轮起每一轮都是双位数秒

会话行业主体找知识知识排序调工具生成轮数生成合计反思反思后重写首答产出时刻类型
T01大家电40.6s0.9s2.0s0.0s316.9s17.0s6.8s15.2sA 反思重写
T02家居53.6s1.4s2.1s0.0s226.2s19.8s17.7s14.1sA 反思重写
T03汽车53.4s0.6s1.1s0.0s448.3s0.1s0.0s38.3sB 多轮 Loop
T04文教香氛48.7s1.7s2.0s1.4s321.0s19.2s7.9s20.1sA 反思重写
T05快消40.5s1.2s2.2s3.3s331.4s0.1s0.0s24.2sB 多轮 Loop
T06宠物40.2s0.6s1.4s0.0s326.3s0.0s0.0sB 多轮 Loop
T07家装44.2s1.6s3.0s0.0s319.6s12.9s8.3s19.8sA 反思重写
T08食品生鲜40.4s1.3s1.1s3.8s331.1s0.1s0.0s27.3sB 多轮 Loop
T09玩具潮玩38.5s0.6s1.7s1.6s432.4s0.0s0.0sB 多轮 Loop

首答产出时刻以反思启动时刻定位;宠物与玩具潮玩两条完全没有触发反思,无法定位首答时刻,记为「—」。两类会话的共同点:父流程自身的调度空隙 9 条里有 8 条只有 1.3–4.3 秒,只有宠物那条达到 10.9 秒,框架开销总体可以排除,时间确实花在模型上。另有 4 条会话带主体之外的收尾动作(上下文压缩、会话后主动触达,最长 27.0 秒),它们都在答案发出之后才启动,不算买家等待,如果按账面累加会把等待时长虚高一截。

放大到 240 条:多等的 22.57 秒,六成花在想答案、写答案上

上面 9 条是各行业的最慢极值,只能定性。这里再随机抽 240 条真实会话——超 30 秒的 120 条、30 秒以内的 120 条——把每条的时间轴按环节归类,同一个环节在两组之间差多少,一目了然。

工具调用耗时

慢组的售前主agent墙钟均值 32,737 毫秒,30 秒以内组 10,170 毫秒,多等的 22.57 秒里 60.22% 被想答案、写答案这一步吃掉,反思复核再吃 8.90%,两项合计近七成。而且大模型不是单次变慢,是被叫的次数变多——慢组有 58.33% 的轮次调了 3 次以上,30 秒以内组只有 6.67%。真正意义上的工具(调工具、商品推荐工具)加起来只解释 11.94% 的增量,且差别主要在命中率而非单次快慢:调工具在慢组 45.83% 的轮次里出现,在 30 秒以内组只有 11.67%,单次耗时却只差 1.53 倍。找知识和知识排序更不是瓶颈,两项合计在慢组 5.75 秒、在 30 秒以内组 3.99 秒,只多了 1.76 秒,合起来只解释 8.38% 的增量;它们在 30 秒以内组占主体的 43.04%,到了慢组反而只剩 17.57%——不是它们变慢了,是分母被写答案撑大了。

这一轮调了什么慢组命中轮次占慢组慢组均值占30秒以内组该组均值
想答案、写答案11495.00%19,859 ms85.00%6,208 ms
调工具5545.83%4,377 ms11.67%2,863 ms
反思复核9377.50%3,874 ms65.83%1,510 ms
商品推荐工具4840.00%3,376 ms17.50%1,879 ms
知识排序10990.83%3,278 ms83.33%2,376 ms
找知识11091.67%2,473 ms85.00%1,617 ms
转人工判定(答案写完后)11192.50%1,074 ms70.83%480 ms
会话摘要1512.50%1,030 ms10.00%1,005 ms
答案定稿加工10083.33%714 ms65.00%483 ms
看图找货与图文作答8873.33%416 ms62.50%295 ms
准入校验10890.00%357 ms85.00%314 ms
拒答判定9680.00%265 ms73.33%150 ms
配置解析10990.83%130 ms69.17%116 ms

本模块口径与全篇不同,需单独看:耗时明细底表只保留最近 7 天,全报告首日的分区已过期不可回溯,因此这 240 条抽自 08-02 至 08-06 五天,其余章节仍是全篇的六天全量。五天口径下超 30 秒 21,700 轮、30 秒以内 537,118 轮,抽样与总体在行业、接待模式两个维度上的最大偏差为慢组行业 3.11 个百分点、慢组接待模式 1.85 个百分点、30 秒以内组行业 4.86 个百分点、接待模式 6.37 个百分点,都落在 120 条抽样的正常波动内;慢组抽样覆盖 34 家店、会话均值 34,612 毫秒,30 秒以内组覆盖 43 家店、均值 12,020 毫秒。「占慢组」是命中率(该轮至少调用一次),不是构成占比,各行相加不等于 100%;「均值」指命中轮次内该环节多次调用的累计耗时再取平均,因此想答案、写答案一行的 19,859 毫秒已含同一轮里的多次调用。各行不能直接相加当买家等待:主体结束后才启动的上下文压缩与会话后主动触达已全部剔除,另有 13 处环节存在时间区间嵌套、仅占 4,678 条时间轴记录的 0.28%,可忽略。表内 13 个具名环节合计解释了两组主体墙钟差额的 94.99%,剩余 5.01% 是父流程自身的调度空隙。

再钻一层:反思复核触发得有多频繁

上表已经锁定:多等的 22.57 秒里,想答案、写答案加反思复核合计吃掉近七成。下面沿同一批 240 条抽样再往下钻一层,回答三个问题:反思复核被触发得有多频繁;触发之后答案被打回重写了几遍、每一遍耗时多少、最终是谁给出答案;由此反思环节的轮次、时长、判定标准应该定在哪。先讲清一个日志事实:每轮会话里反思环节只出现一次(171 条触发轮次无一例外,内部多次判定的耗时都聚合在这一步里),所以「反思 1 次、2 次、3 次」在日志里对应的是「反思后答案被重写 1 次、2 次、3 次」,下面的分档全部按重写次数呈现。

触发占比

超 30 秒组 120 条抽样轮次里 95 条触发了反思复核(79.17%);本来就正常的 30 秒以内组也有 63.33% 触发。触发不是慢会话的专属现象——判定松到正常答案也在被大量检查打回,这是第五章收紧判定标准的直接依据。

组别抽样轮次触发反思触发占比
超 30 秒组1209579.17%
30 秒以内组1207663.33%
合计24017171.25%

本表触发率按售前主链路的反思环节本身统计;上面环节表里「反思复核」的命中率(77.50% / 65.83%)额外要求该环节落在主体墙钟窗口内、且合并了辅助链路的复核变体,两个口径的差都在 2 个百分点以内,不影响结论。未触发反思的 69 条(慢组 25、快组 44)大多走的是另一条链路——慢组未触发轮次里 36.00% 由兜底知识库agent直接回复,反思环节不在那条链路上。因此触发组与未触发组的结局不可直接对比(选择偏差),下面只在触发组内部按重写次数分档比较。

反思打回重写:每多写一遍多等 4~7 秒,结局没有变好

分档结果

重写 2 次是最大档(占触发 49.47%),2 次及以上合计 87.37%。每多重写一遍,重写段平均耗时递增约 4~7 秒(6.9 → 13.9 → 18.2 → 22.4 秒),但自答率没有随之上升:重写 1 次档 80.00%,2 次档降到 68.09%,4 次及以上档只剩 62.50%、转人工升到 37.50%(约是重写 1 次档 10.00% 的近四倍)。多写不换来更好的结局,只换来更长的等待。

反思后重写次数轮次数占触发比平均总耗时重写段平均耗时自己答完转人工兜底知识库agent回复转交售后agent
判定通过未重写22.11%34.1 秒2(100.00%)
重写 1 次1010.53%35.6 秒6.9 秒8(80.00%)1(10.00%)1(10.00%)
重写 2 次4749.47%34.0 秒13.9 秒32(68.09%)11(23.40%)4(8.51%)
重写 3 次2829.47%34.3 秒18.2 秒23(82.14%)5(17.86%)
重写 4 次及以上88.42%38.6 秒22.4 秒5(62.50%)3(37.50%)

30 秒以内组同样的分档作为佐证:多写一遍代价约 6 秒,结局几乎不动。

反思后重写次数轮次数占触发比平均总耗时重写段平均耗时自己答完转人工兜底知识库agent回复转交售后agent
判定通过未重写67.89%14.7 秒6(100.00%)
重写 1 次3444.74%12.4 秒5.2 秒31(91.18%)2(5.88%)1(2.94%)
重写 2 次3140.79%18.4 秒8.8 秒30(96.77%)1(3.23%)
重写 3 次56.58%21.8 秒13.1 秒4(80.00%)1(20.00%)

「判定通过未重写」=触发了反思但判定合格、答案未被打回。「重写段平均耗时」=该轮反思之后所有重写耗时的合计均值。小样本档位(慢组重写 1 次 10 条、判定通过 2 条、4 次及以上 8 条,快组重写 3 次 5 条)只读方向不读精度。慢组各档平均总耗时接近是抽样入组条件所致(都超 30 秒),组内比较看重写段耗时与结果分布,跨组比较看总耗时。各档结果占比分母为该档轮次数。

再看失败成本:171 条触发轮次里有 28 条(16.37%)反思加重写全部走完,最终还是转人工或兜底知识库agent回复,其中慢组 24 条白等里 23 条落在重写 2 次及以上档。反思没能挽救这些答案,反而把买家平均多拖住 20.0 秒(最长 45.7 秒)才把人交出去——买家付出了最长的等待,拿到的仍是最差的结果,和上文「答案来源」小节的双重损失结论互相印证。

反思的最佳配置:重写限 1 次、限时 6 秒、只打回硬伤

① 最佳轮次:反思后重写限 1 次。每轮反思环节只出现一次,「反思限 1 次」在环节级已是现状,真正失控的是反思触发的重写。分档表给出两条证据:结局上,慢组重写 2 次及以上合并自答率 72.29%,低于重写 1 次档的 80.00%;快组 2 次及以上 94.44% 只比 1 次档 91.18% 高 3.26 个百分点,平均总耗时却从 12.4 秒涨到 18.9 秒——多写一遍约多付 6.5 秒,结局几乎不变。成本上,重写段耗时每多一遍递增约 4~7 秒,纯线性堆等待。所以保留第 1 次重写(它有价值),第 2 次起截断;按抽样直接扣除口径模拟,仅这一条慢组 48.33% 的轮次可压回 30 秒以内。

② 最佳时长:6 秒,不伤中位数、只砍尾部。反思单步耗时慢组 P50 只有 2.0 秒,但尾部很长:P90 9.6 秒、最长 20.2 秒,超 6 秒的占 21.05%(20 / 95);快组 P50 1.1 秒、P90 3.0 秒、最长 8.2 秒,超 6 秒的仅 3.95%。限时 6 秒不影响中位数场景,单独可压回 10.83%。

③ 最佳标准:只有价格、库存、承诺类硬伤才打回。本来就在 30 秒内答完的正常会话,反思触发率也有 63.33%,触发后还有 47.37% 被打回重写两遍以上——说明「不合格」判得太松。收紧方向是只有价格、库存、承诺类硬伤才触发重写,风格瑕疵不打回;这一条无法用日志模拟收益,需上线后用答案质量与转化指标做 AB 护栏验证。

反思配置收益

前两条可模拟的动作叠加:慢组 86 条受影响、受影响轮次平均省 7.4 秒,64 条(53.33%)压回 30 秒以内。第三条判定收紧的收益需 AB 验证,未计入。第五章第一条动作即按这套配置落地。

动作影响面(慢组)压回 30 秒内
反思后重写限 1 次83 / 12058 条(48.33%)
反思限时 6 秒20 / 12013 条(10.83%)
两条叠加86 / 12064 条(53.33%)

模拟为「直接扣除」口径:把超限部分的耗时从该轮总耗时中直接减去,环节按串行处理;不计上下文变短带来的额外加速(偏保守),也不计答案质量变化(需 AB 护栏)。此处叠加的 53.33% 与第五章收益一览里「生成封顶 2 轮(积极档)」的 53.33% 数字相同,纯属巧合:那边封顶的是一轮里的总生成次数,这边限的是反思后的重写次数——两个动作都在压缩生成次数、效果高度重叠,不可相加、也不可互相替代。

三、买家体验展示

先看类型 A。家居行业,买家在看压缩袋,问尺寸。

07:38:48买家:中立体大小
07:39:02买家:长宽高分别是多少 ← 等了 14 秒没动静,自己把问题重问了一遍
07:39:24机器人:中立体尺寸是 50×70×30cm(长×高×宽),高约 70cm,底部约 50×30cm。适合收纳 25 件 T 恤或 5-8 件羽绒服 ← 距第一次提问 36 秒

这是一个查规格参数就能答的问题,答案本身也只有一句话。同一通会话往后,买家问到两款电泵的差别:

07:52:32买家:这两款电泵有什么区别
07:53:06机器人:小主,您问的是哪两款电泵呀?可以发我看看,我帮您对比下参数和功能~ ← 等 34 秒,换来一句反问

此后买家消失了 13 分钟,回来时直接甩了两条商品链接,再也没打字提问。

再看类型 B。汽车行业,买家想换一个能线上充值的设备,机器人给了三款让他挑。

10:35:43买家:有推荐吗
10:35:50买家:这几款有什么区别
10:36:16买家:看不懂 ← 连问三句,26 秒还没等到答案
10:36:42机器人:马上帮您处理,稍等我一下下~
10:36:54机器人:我给您简单对比下这三款:(三款逐条对比,含商品链接) ← 距「这几款有什么区别」64 秒

最终这条对比答得相当好——三款按使用场景讲清了差别,还反问了跑高速的频率。问题不在质量,在于买家已经先打出了「看不懂」。一个答得对但来得晚的答案,在买家侧和答错的区别不大;而买家在等待期间连发的三条消息,每一条都可能触发新一轮生成,让这一轮变得更慢。

单通会话不能当受控实验看,这两通的作用是让上面的秒数落地成买家的真实体验。会话编号与真实会话标识的对应关系保留在内部版分析文档中。

四、行业分布:一个行业、一家店的问题

行业与集中度

大家电一个行业就占了全体超 30 秒的 60.50%,自身超 30 秒比例 8.86%,是第二名文教香氛(4.67%)的近两倍。而集中度比比例更值得看:两家大家电旗舰店分别贡献 7,180 轮和 7,169 轮,各自就占全体超 30 秒的 23% 上下,两家合计 46.00%;前 3 家店合计 51.17%;前 30 家店合计 87.91%。这意味着大盘指标可以被极少数店铺的链路配置绑架。

行业总轮次超30秒轮次超30秒比例占全体超30秒超30秒均值
大家电212,96918,8708.86%60.50%34,487 ms
文教香氛30,9431,4444.67%4.63%35,578 ms
宠物53,0091,9013.59%6.09%33,838 ms
家居16,1034752.95%1.52%33,679 ms
快消175,8385,1382.92%16.47%34,454 ms
工业品2,550592.31%0.19%32,900 ms
汽车11,6502572.21%0.82%33,364 ms
鲜花园艺7,4781281.71%0.41%31,948 ms
食品生鲜49,8268351.68%2.68%33,634 ms
玩具潮玩35,4865731.61%1.84%34,635 ms
家装77,0669251.20%2.97%35,496 ms
黄金饰品42,2975011.18%1.61%33,840 ms
数字生活6,799731.07%0.23%33,609 ms
商业农业1,988110.55%0.04%33,645 ms
个性定制1,05820.19%0.01%34,192 ms

接待模式:不是「辅助模式更慢」

接待模式

全自动侧 4.70%、辅助模式侧 3.50%,两者只差 1.2 个百分点,模式本身解释不了什么。真正的反差在行业内部:家装的全自动侧超 30 秒比例 6.33%,辅助模式侧只有 0.04%,相差 166 倍,说明家装这两条链路的配置差异极大;汽车正好相反,辅助模式侧 4.80% 高于全自动侧 1.52%;玩具潮玩与黄金饰品的辅助模式侧一条都没有。

接待模式总轮次超30秒轮次超30秒比例超30秒均值单轮最长
全自动485,49222,8084.70%35,568.2 ms60,745 ms
辅助模式239,5708,3843.50%31,424.1 ms37,574 ms
合计725,06231,1924.30%34,454.3 ms60,745 ms

超 30 秒会话的时长分档(合计 31,192 轮)

30–40 秒 27,440 轮
40–60 秒 3,749

60–90 秒仅 3 轮,90 秒以上 0 轮。辅助模式的 8,384 轮全部落在 30–40 秒档,也就是说 40 秒以上的 3,752 轮全部来自全自动侧

两种病因,按行业分组

病因分组

大盘慢组的兜底知识库命中率 5.94% 是基准线。玩具潮玩、汽车、食品生鲜、黄金饰品、数字生活五个行业都在 10% 以上,鲜花园艺与家居次之,这些行业的慢是「找不到答案所以反复想」;大家电、文教香氛、家居、家装、玩具潮玩、快消的平均轮次都在 4.25 以上,这些行业的慢是「上下文越堆越长、生成轮数越来越多」。家居与玩具潮玩两头都占。

行业慢组平均轮次快组平均轮次慢组兜底知识库命中率快组命中率病因
大家电5.343.434.90%1.28%聊得深(且是量级担当)
文教香氛5.193.276.37%0.76%聊得深
家居4.953.037.08%1.02%聊得深 + 知识不够
家装4.883.476.33%1.28%聊得深
玩具潮玩4.763.0213.79%1.76%知识不够 + 聊得深
快消4.272.885.63%1.21%聊得深
汽车3.922.9113.57%0.83%知识不够
宠物3.882.856.14%0.75%聊得深(偏轻)
工业品3.872.884.35%0.97%样本过小,不下结论
食品生鲜3.522.5211.78%0.60%知识不够
鲜花园艺3.303.098.70%0.70%知识不够
黄金饰品3.222.4411.78%0.51%知识不够
数字生活3.132.6910.94%2.49%知识不够

五、如何优化

反思触发的重写限 1 次,并对反思限时 6 秒

第二章的反思分档已经证实:「反思限 1 次」在环节级是现状(每轮反思环节只出现一次),真正失控的是反思触发的重写——慢组触发轮次里重写 2 次及以上占 87.37%,多写一遍既不提高自答率、还要多付 4~7 秒。极值侧同样成立:反思环节没有触发条件也没有时间上限,实测花 12.9–19.8 秒,判定不合格后的重写再花 6.8–17.7 秒——而第一版答案在第 17.3 秒就已经存在。动作按第二章「反思的最佳配置」落地:反思触发的重写限 1 次,第 2 次起截断、直接把已有答案发出去;反思单步限时 6 秒;判定标准收紧为只有价格、库存、承诺类硬伤才打回。按 240 条抽样模拟,重写限 1 次单项压回 58 条(48.33%),反思限时 6 秒单项影响慢组 20 条轮次、受影响轮次平均省 6.1 秒、压回 13 条(10.83%),两者叠加压回 64 条(53.33%)。

Loop 轮数要随对话深度递减

轮次曲线已经说明第 2 轮 Loop 起每一轮都是双位数秒,而超 30 秒比例从首轮 1.82% 单调涨到 16 轮以上的 17.31%。建议对话进行到第 5 轮起不再启用第 3 轮 Loop,第 9 轮起不再启用第 2 轮 Loop,并按轮次窗口截断带进模型的上下文。这不是降级,是让深聊会话别越聊越等。按 240 条抽样模拟:只封第 4 轮及以上 Loop(保守)影响慢组 20 条、单项压回 13 条;封顶到 2 轮(积极)影响 70 条、受影响轮次平均省 11.6 秒、单项压回 64 条(53.33%)——四条动作里单项收益最大的就是它,也是唯一能把大盘占比砍掉一半以上的一条。

同 trace 不再多次调用同工具 Loop

9 条极值会话的 Loop 跑了 2–4 轮,其中工具调用最多的一条花掉 3.8 秒——同一轮对话里,同一个工具很可能被反复调了几遍。建议在链路侧加一条约束:同一 trace 内同一工具只允许调用一次,出参在本轮内缓存复用,后续 Loop 直接取缓存而不是重新发起。按 240 条抽样模拟,同名工具去重影响慢组 11 条、受影响轮次平均省 6.1 秒、单项压回 4 条;单看量不大,但它与前两条叠加时能把贴线轮次推过 30 秒线,而且实现成本最低。

按行业分两组配链路

第一组是聊得深的行业:大家电、文教香氛、家装、家居、快消、玩具潮玩。这几个行业的病主要不是知识不够,动作应该落在上下文窗口治理和 Loop 轮数预算上。大家电还要单独做店铺专项——两家店合计占全体超 30 秒的 46.00%、前 3 家占 51.17%,先把这 3 家的 Loop 轮数上限和反思开关调一遍,收益比任何全局改动都大,而且不影响其他行业。

第二组是知识不够的行业:汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活、鲜花园艺。这几个行业的病是找不到知识、于是反复想、最后转给兜底知识库agent回复,而这条路径的均值 37,491 毫秒是所有答案来源里最慢的。动作有两个:一是补知识,优先级最高的是活动规则(活动咨询是最慢场景 36,284 毫秒,且在慢组里的占比是快组的两倍多),其次是商品咨询里的规格与适配类;二是给这条路径设硬预算,一旦确定要由兜底知识库agent回复,就不要再触发重写。

四条动作的收益一览

预期收益

按 240 条抽样做「直接扣除」模拟:三条链路动作叠加,保守档(生成只封第 4 轮及以上)可把慢组 23.33% 的轮次压回 30 秒以内,大盘超 30 秒占比从 4.30% 降到 3.30%;积极档(生成封顶 2 轮)可压回 64.17%,大盘降到 1.54%。收益主要来自生成封顶,反思侧动作与工具去重是护航项(重写限 1 次与生成封顶效果重叠,未计入叠加)。积极档动作更狠,需要先用答案质量与转化指标做 AB 护栏,再决定全量。

动作影响面(慢组)单项压回30秒内受影响轮次平均省时责任方节奏
反思触发的重写限 1 次+反思限时 6 秒77.50% 轮次带反思复核58–64 / 1207.4 秒链路配置当周可灰度
Loop 轮数随对话深度递减58.33% 轮次生成 3 次以上13–64 / 1207.7–11.6 秒链路配置 + 算法1–2 周 AB
同 trace 同工具只调 1 次45.83% 轮次有工具调用4 / 1206.1 秒链路配置当周可灰度
按行业分组配链路 + 两店专项两家店占全体 46.00%放大前三条收益行业运营 + 商家2–4 周
三条链路动作叠加28–77 / 1209.0–12.2 秒

模拟口径:在 240 条抽样(超 30 秒 120 条)的真实时间轴上把动作规则直接套用——反思每次封顶 6 秒、答案生成每轮对话只保留前 3 轮(保守)或前 2 轮(积极)、同名工具的重复调用去掉——省下的毫秒数从该轮总耗时里直接扣除,再看有多少条落回 30 秒以内。三个假设需要交代:环节按串行处理,砍掉的调用不影响剩余环节的耗时;未计入上下文变短带来的额外提速(这一点偏保守);也未计入答案质量的变化(需要 AB 验证)。各单项的压回条数相加不等于叠加值,因为同一条轮次可能被多条动作同时命中。第一行动作已按第二章反思分档升级为「重写限 1 次+限时 6 秒」(重写限 1 次单项 58 条、加限时后 64 条);它与生成封顶都在压缩生成次数、效果高度重叠,故「三条链路动作叠加」行仍按原三项口径(反思限时+生成封顶+工具去重)计算、未叠加重写限 1 次,保守档合计因此可能低于第一行单项,两者不可相加。

附录 A 抽样与校验

按需求随机抽取每个行业 30 条做段级校验,落在本窗口的共 355 条、覆盖 15 个行业75 家店(行业轮次不足 30 条的按实际抽满)。抽样样本的售前主agent占比中位数 0.969,三段相加与总耗时的最差偏差 1 毫秒,说明分段口径在样本上同样成立。抽样里最慢的是文教香氛(中位 37.53 秒),最快的是宠物(31.96 秒)。

9 条逐条还原的极值会话就是从这批样本里按每行业最慢一条挑出来的,有一条需要交代:玩具潮玩行业最慢的那条是视频输入、且中途转了人工,与「全部为全自动接待的纯售前文字会话」的口径不符,因此顺延取该行业第二慢的一条(41.3 秒)。另有一个原本想用的原因编码字段在两组样本里全为空值,本次未采用。

附录 B 行业范围

本次分析在数据层剔除闲置、拍卖、酒旅三个行业后重新聚合,保留 18 个行业白名单,其中实际有数据的 15 个进入上文各表;白名单内另有 3 个行业在窗口内无数据或轮次过少(不足 5 轮)而未单独列示。所有分母、占比、均值都基于剔除后的样本重算,不是把这三行从表格里隐掉。行业归属按店铺主营类目映射,一店多类目时取权重最高的一个。