售前·高阶版:总耗时超过 30 秒的会话,慢在哪

窗口 07-31 至 08-06(7 天)· 全自动与辅助模式两种接待模式全量口径 · 极值会话 9 条逐段还原 + 段级抽样 393 条交叉校验

口径:高阶版 买家级分桶归属 已在数据层剔除闲置、拍卖、酒旅三个行业,保留 18 个行业白名单 深挖抽样仅取全自动接待
一句话结论

7 天里有 37,551 轮买家等了 30 秒以上,每 22 轮就有 1 轮。多出来的时长 98% 落在售前主agent这一段,不是某个环节变慢;而且高度集中——大家电一个行业占六成,一家店就占两成

总体占比
37,551·4.5247%
每 22 轮就有 1 轮,买家等过 30 秒
分母:全部 829,912 轮
行业分布
23,013·61.28%
大家电一个行业占掉六成
该行业自身 9.209%,是第二名的近 2 倍
重点商家分布
8,609·22.9%
一家店就占两成,前 30 店占 65.1%
前 3 店合计 38.4%,可做单店专项
全自动占比
27,071·4.9394%
40 秒以上的全部落在全自动侧
分母:全自动 548,068 轮
辅助模式占比
10,480·3.7184%
辅助模式没有一轮超过 40 秒
最长 37,574 毫秒;分母 281,844 轮

超过 30 秒的会话平均等待 34,440.3 毫秒,单轮最长 63,125 毫秒。行业与商家两张卡是「谁贡献了这些轮次」的口径(分母是全体超 30 秒),两张接待模式卡是「这种模式自己有多容易超」的口径(分母是该模式总轮次),两类占比不能相加。

行业范围:本次剔除闲置、拍卖、酒旅三个行业,保留 18 个行业白名单,实际有数据 15 个。剔除动作在数据层重新聚合后重跑,而非在展示层把行隐藏——所有占比、均值、分母都按剔除后的样本重算。

一、四个澄清

超 30S 的 RT 已收敛

逐日从 6.065% 降到 2.22%,说明前期的反思限时动作确实在生效。同时盯住两个行业:家居从 1.74% 到 1.94%、期间峰值 4.43%;汽车流量从 357 轮涨到 2,679 轮,比例在 0.28% 到 2.22% 之间波动,属于正在放量的新行业,需要单独观察。

0% 2% 4% 6% 6.065% 5.732% 5.518% 4.990% 3.842% 3.463% 2.221% 07-3108-01 08-0208-03 08-0408-05 08-06 当日总轮次 当日超 30 秒占比 7 天累计下降 63%

图中灰柱为当日总轮次(10.5 万至 12.6 万轮,8 月 4 日达峰后小幅回落),蓝色折线为当日超 30 秒占比,含全部接待模式。七天里占比一路单调下行、中间没有一天反弹。

不是超时报错

超 30 秒组和 30 秒以内组的异常发生率都是 0。时长分布也不像被掐断:30–40 秒占 87.98%,60 秒以上只有 5 轮,最长 63,125 毫秒。

这些会话是正常跑完的,只是跑得久。

不是图片和多模态

超 30 秒的 26,522 轮里,非文字输入只有 3 轮(都是点击卡片)。图片识别环节虽然在慢组里超 1 秒的比例更高(3.99% 对 1.94%),但它的均值只有 105 毫秒。

这是一个极小的子群,不是主因。

不是某个节点变慢

34 个有名字的识别与后处理节点,在一轮超 30 秒的会话里加起来只有 1,252.3 毫秒,只解释 3.52%。增量最大的商品识别节点也只多了 52.3 毫秒。

换句话说,节点级优化这条路,天花板不到一秒。

不是最近才出现的问题

上面那条曲线不是靠流量摊薄出来的:按店铺分层看,头部 3 家店从 12.63% 降到 5.76%,其余店从 4.17% 降到 1.80%,两侧同时改善,末日大盘 2.2205%。

诚实标注:头部 3 店流量同期从 19,527 轮降到 16,533 轮,其余店从 43,049 轮涨到 64,367 轮,所以大盘那条下降曲线里既有真实改善,也有流量结构位移,两者不能混算。

二、慢在哪:98% 的落在售前主agent这一段

把一轮的总耗时拆成三段——前置识别(认商品、认订单、判断要不要转人工)、售前主agent(找知识、想答案、写答案)、回复后处理(分场景、贴卡片、发出去)。三段相加等于总耗时(闭合系数 0.9999981)。

分段归因

一轮多出来的 21.5 秒,98.088% 落在售前主agent这一段——找知识、想答案、写答案。前置识别只多了 198.8 毫秒,回复后处理只多了 57.7 毫秒,两段加起来占增量不到 1.2%。也就是说,能优化的地方只有一处。

分段超30秒组均值30秒以内组均值差值倍数占总增量
一轮总耗时35,609.6 ms14,126.0 ms+21,483.6 ms2.52×100%
售前主agent34,092.8 ms13,020.0 ms+21,072.8 ms2.62×98.088%
前置识别998.7 ms799.9 ms+198.8 ms1.25×0.925%
回复后处理273.4 ms215.7 ms+57.7 ms1.27×0.269%

多出来的 21.5 秒,钱花在哪

售前主agent 98.09%

橙 0.93% 前置识别 · 蓝 0.27% 回复后处理 · 灰 0.71% 段间调度。售前主agent本身占一轮的 95.74%,且在耗时明细里没有内部拆分,要再往下看只能逐条还原会话日志——下面就是这么做的。

越往后聊越慢,单调上升没有拐点

对话深度

从首轮的 1.916% 到 16 轮以上的 18.137%,翻了 9.5 倍,中间没有任何一档回落。超 30 秒的会话平均已经聊到第 4.88 轮,30 秒以内的只到第 3.02 轮。这条曲线是后面所有动作建议的基础:慢不是随机发生的,是随着对话变深必然发生的

对话进行到第几轮总轮次超30秒轮次超30秒比例该档平均耗时
第 1 轮182,9243,5051.916%9,950 ms
第 2 轮127,8185,7414.492%16,646 ms
第 3–4 轮126,3337,5635.987%17,808 ms
第 5–8 轮74,3695,8417.854%18,745 ms
第 9–15 轮24,1282,95712.255%20,494 ms
第 16 轮以上5,04591518.137%22,502 ms

而且慢的都是真问题,不是打招呼

诉求类型

寒暄类在慢组里只占 10.4%,在快组里占 37.2%——快的那一半有三分之一根本不用想答案。而活动咨询是最慢的场景(36,402 毫秒),并且它在慢组里的占比(19.5%)是快组(9.4%)的两倍多,说明活动规则这类知识最容易把机器人拖进长时间思考。

买家在问什么超30秒轮次占慢组慢组均值占30秒以内组该组均值
商品咨询15,57057.5%35,468 ms44.5%16,750 ms
活动咨询5,28619.5%36,402 ms9.4%17,422 ms
未识别出诉求(多为寒暄)2,82710.4%35,023 ms37.2%9,426 ms
商品推荐2,0057.4%35,628 ms4.3%17,447 ms
售后问题5752.1%35,930 ms0.9%19,141 ms
售前物流4611.7%34,461 ms2.4%16,454 ms
购买操作3291.2%35,599 ms1.3%16,036 ms
发货物流180.1%34,605 ms0.05%18,478 ms

买家等最久的,恰恰是机器人最后没自己答上来的那些

答案来源

等 37.59 秒换来一句兜底知识库agent的回复、等 37.79 秒最后还是转人工,都比机器人自己答完(35.42 秒)更慢。买家付出了最长的等待,拿到的却是最差的结果,这是双重损失。

这一轮最后谁给出的答案超30秒轮次慢组均值30秒以内轮次该组均值倍数
售前主agent自己答的23,66635,417 ms476,14114,194 ms2.49×
兜底知识库agent回复1,21937,591 ms4,93612,836 ms2.93×
最后还是转了人工1,12037,788 ms31,49811,766 ms3.21×
转交售后agent90135,548 ms6,49719,755 ms1.80×

换独立字段交叉验证结论一致:走兜底知识库agent的会话在慢组里 1,257 轮、均值 37,410 ms,在快组里 4,963 轮、均值 12,760 ms。兜底知识库agent的命中率,慢组 5.60% 对快组 1.14%,差 4.9 倍。

逐条还原:9 条最慢会话,存在 2 类典型问题

每个行业取最慢 1 条、共 9 条(40.4–59.8 秒),全部是全自动接待的纯售前会话,把日志里的子流程按真实起止时刻重排成时间轴。

极值会话

9 条会话逐条拆开后,慢的原因只有 2 类:一类是答案早就写好了,卡在反思;另一类是一句话 Loop 好几轮才写完。两类都不是环节变慢,而是同一段里被反复执行。

类型 A:答案早就写好了,卡在反思(5 条)

平均主体 50.5 秒。第一版答案平均在第 19.4 秒就已经产出,之后的反思花 12.9–19.8 秒,判定不合格再重写一遍又花 8.1–17.7 秒,买家为此又多等了 31.1 秒。反思加重写合计 26.9 秒,等于主体的 53.4%。

类型 B:一句话 Loop 好几轮才写完(4 条)

平均主体 44.2 秒,没有反思环节,纯粹是生成轮数多。生成合计占主体的 77%–90%,最极端的汽车那条 48.3 秒、占 90.4%。第 1 轮平均 3,340 毫秒,第 2 轮就跳到 12,519 毫秒,第 3 轮 10,928 毫秒,第 4 轮 8,941 毫秒——第 2 轮起每一轮都是双位数秒

会话行业主体找知识知识排序调工具生成轮数生成合计反思反思后重写首答产出时刻类型
T01大家电59.8s2.1s2.6s1.8s431.2s15.7s8.1s22.3sA 反思重写
T02家居53.6s1.4s2.1s0.0s226.2s19.8s17.7s14.1sA 反思重写
T03汽车53.4s0.6s1.1s0.0s448.3s0.1s0.0s38.3sB 多轮 Loop
T04文教香氛48.7s1.7s2.0s1.4s321.0s19.2s7.9s20.1sA 反思重写
T05快消40.5s1.2s2.2s3.3s331.4s0.1s0.0s24.2sB 多轮 Loop
T06宠物42.5s1.2s1.5s4.2s434.9s0.1s0.0s42.0sB 多轮 Loop
T07家装44.2s1.6s3.0s0.0s319.6s12.9s8.3s19.8sA 反思重写
T08食品生鲜40.4s1.3s1.1s3.8s331.1s0.1s0.0s27.3sB 多轮 Loop
T09玩具潮玩46.0s0.6s2.3s3.6s422.3s16.0s8.3s20.5sA 反思重写

两类会话的共同点:父流程自身的调度空隙只有 1.4–4.3 秒,框架开销可以排除,时间确实花在模型上。另有 3 条会话带主体之外的收尾动作(上下文压缩、会话后主动触达,最长 27.0 秒),它们都在答案发出之后才启动,不算买家等待,如果按账面累加会把等待时长虚高一截。

三、买家体验展示

先看类型 A。家居行业,买家在看压缩袋,问尺寸。

07:38:48买家:中立体大小
07:39:02买家:长宽高分别是多少 ← 等了 14 秒没动静,自己把问题重问了一遍
07:39:24机器人:中立体尺寸是 50×70×30cm(长×高×宽),高约 70cm,底部约 50×30cm。适合收纳 25 件 T 恤或 5-8 件羽绒服 ← 距第一次提问 36 秒

这是一个查规格参数就能答的问题,答案本身也只有一句话。同一通会话往后,买家问到两款电泵的差别:

07:52:32买家:这两款电泵有什么区别
07:53:06机器人:小主,您问的是哪两款电泵呀?可以发我看看,我帮您对比下参数和功能~ ← 等 34 秒,换来一句反问

此后买家消失了 13 分钟,回来时直接甩了两条商品链接,再也没打字提问。

再看类型 B。汽车行业,买家想换一个能线上充值的设备,机器人给了三款让他挑。

10:35:43买家:有推荐吗
10:35:50买家:这几款有什么区别
10:36:16买家:看不懂 ← 连问三句,26 秒还没等到答案
10:36:42机器人:马上帮您处理,稍等我一下下~
10:36:54机器人:我给您简单对比下这三款:(三款逐条对比,含商品链接) ← 距「这几款有什么区别」64 秒

最终这条对比答得相当好——三款按使用场景讲清了差别,还反问了跑高速的频率。问题不在质量,在于买家已经先打出了「看不懂」。一个答得对但来得晚的答案,在买家侧和答错的区别不大;而买家在等待期间连发的三条消息,每一条都可能触发新一轮生成,让这一轮变得更慢。

单通会话不能当受控实验看,这两通的作用是让上面的秒数落地成买家的真实体验。会话编号与真实会话标识的对应关系保留在内部版分析文档中。

四、行业分布:一个行业、一家店的问题

行业与集中度

大家电一个行业就占了全体超 30 秒的 61.28%,自身超 30 秒比例 9.209%,是第二名文教香氛(4.751%)的近两倍。而集中度比比例更值得看:一家大家电店(84,031 轮)贡献了 8,609 轮,占全体超 30 秒的 22.9%;前 3 家店合计 38.4%;前 30 家店合计 65.1%。这意味着大盘指标可以被极少数店铺的链路配置绑架。

行业总轮次超30秒轮次超30秒比例占全体超30秒超30秒均值
大家电249,90123,0139.209%61.28%34,472 ms
文教香氛35,0421,6654.751%4.43%35,508 ms
宠物62,5152,4263.881%6.46%33,825 ms
快消200,0616,0923.045%16.22%34,451 ms
家居17,4785042.884%1.34%33,598 ms
汽车12,4762692.156%0.72%33,312 ms
工业品2,852592.069%0.16%32,900 ms
食品生鲜54,8869831.791%2.62%33,601 ms
鲜花园艺8,4941421.672%0.38%31,901 ms
玩具潮玩40,3456691.658%1.78%34,678 ms
黄金饰品47,7526021.261%1.60%33,966 ms
家装87,0511,0361.190%2.76%35,525 ms
数字生活7,550771.020%0.21%33,560 ms
商业农业2,214120.542%0.03%33,358 ms
个性定制1,29220.155%0.005%34,192 ms

接待模式:不是「辅助模式更慢」

接待模式

全自动侧 4.9394%、辅助模式侧 3.7184%,两者只差 1.2 个百分点,模式本身解释不了什么。真正的反差在行业内部:家装的全自动侧超 30 秒比例 6.561%,辅助模式侧只有 0.0335%,相差 196 倍,说明家装这两条链路的配置差异极大;汽车正好相反,辅助模式侧 4.403% 高于全自动侧 1.474%;玩具潮玩与黄金饰品的辅助模式侧一条都没有。

接待模式总轮次超30秒轮次超30秒比例超30秒均值单轮最长
全自动548,06827,0714.9394%35,609.6 ms63,125 ms
辅助模式281,84410,4803.7184%31,419.7 ms37,574 ms
合计829,91237,5514.5247%34,440.3 ms63,125 ms

超 30 秒会话的时长分档(合计 37,551 轮)

30–40 秒 33,038 轮
40–60 秒 4,508

60–90 秒仅 5 轮,90 秒以上 0 轮。辅助模式的 10,480 轮全部落在 30–40 秒档,也就是说 40 秒以上的 4,513 轮全部来自全自动侧

两种病因,按行业分组

病因分组

大盘慢组的兜底知识库命中率 5.60% 是基准线。汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活五个行业都在 10% 以上,鲜花园艺与家居次之,这些行业的慢是「找不到答案所以反复想」;文教香氛、大家电、家装、家居、快消、宠物的平均轮次都在 4.25 以上,这些行业的慢是「上下文越堆越长、生成轮数越来越多」。家居两头都占。

行业慢组平均轮次快组平均轮次慢组兜底知识库命中率快组命中率病因
文教香氛5.363.255.96%0.74%聊得深
大家电5.333.434.69%1.33%聊得深(且是量级担当)
家装4.903.465.73%1.21%聊得深
家居4.893.017.39%1.00%聊得深 + 知识不够
玩具潮玩4.663.0413.22%1.75%知识不够
快消4.252.885.38%1.28%聊得深
汽车3.912.9013.48%0.83%知识不够
宠物3.912.875.30%0.80%聊得深
工业品3.872.874.35%0.97%样本过小,不下结论
食品生鲜3.412.5110.92%0.58%知识不够
黄金饰品3.272.4411.04%0.50%知识不够
鲜花园艺3.153.247.69%0.64%知识不够
数字生活3.062.6510.45%2.36%知识不够

五、如何优化

单 trace 只反思 1 次

目前的反思环节没有触发条件也没有时间上限,实测花 12.9–19.8 秒,判定不合格后的重写再花 8.1–17.7 秒——而第一版答案在第 19.4 秒就已经存在。建议同一 trace 内只允许反思 1 次,不再反复复查同一条答案;同时只在第 1 轮以及命中关键风险词时开启反思,并给「反思 + 重写」设一个合计硬预算(建议 6 秒),超预算直接把已有的第一版答案发出去。这一项直接命中 9 条极值里的 5 条,预计能砍掉这类会话主体时长的 30%–50%。

Loop 轮数要随对话深度递减

轮次曲线已经说明第 2 轮 Loop 起每一轮都是双位数秒,而超 30 秒比例从首轮 1.916% 单调涨到 16 轮以上的 18.137%。建议对话进行到第 5 轮起不再启用第 3 轮 Loop,第 9 轮起不再启用第 2 轮 Loop,并按轮次窗口截断带进模型的上下文。这不是降级,是让深聊会话别越聊越等。

同 trace 不再多次调用同工具 Loop

9 条极值会话的 Loop 都跑了 3–4 轮,其中工具调用最多的一条花掉 4.2 秒——同一轮对话里,同一个工具很可能被反复调了几遍。建议在链路侧加一条约束:同一 trace 内同一工具只允许调用一次,出参在本轮内缓存复用,后续 Loop 直接取缓存而不是重新发起。

按行业分两组配链路

第一组是聊得深的行业:大家电、文教香氛、家装、家居、快消、宠物。这几个行业的病不是知识不够,动作应该落在上下文窗口治理和 Loop 轮数预算上。大家电还要单独做店铺专项——一家店占全体超 30 秒的 22.9%、前 3 家占 38.4%,先把这 3 家的 Loop 轮数上限和反思开关调一遍,收益比任何全局改动都大,而且不影响其他行业。

第二组是知识不够的行业:汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活、鲜花园艺。这几个行业的病是找不到知识、于是反复想、最后转给兜底知识库agent回复,而这条路径的均值 37,591 毫秒是所有答案来源里最慢的。动作有两个:一是补知识,优先级最高的是活动规则(活动咨询是最慢场景 36,402 毫秒,且在慢组里的占比是快组的两倍多),其次是商品咨询里的规格与适配类;二是给这条路径设硬预算,一旦确定要由兜底知识库agent回复,就不要再触发重写。

附录 A 抽样与校验

按需求随机抽取每个行业 30 条做段级校验,实际抽中 393 条、覆盖 15 个行业79 家店(行业轮次不足 30 条的按实际抽满)。抽样样本的售前主agent占比中位数 0.959,三段相加与总耗时的最差偏差 1 毫秒,说明分段口径在样本上同样成立。抽样里最慢的是文教香氛(中位 36.66 秒),最快的是黄金饰品(32.90 秒)。9 条逐条还原的极值会话就是从这批样本里按每行业最慢一条挑出来的。

有一处取数批次差异需要交代:耗时明细只保留 7 天,前后两批任务相隔约 1 小时提交,最早一天的分区在此期间开始过期,因此第二批的样本量比第一批小 2.0%(全自动售前 540,617 轮对 548,068 轮)。占比类指标不受影响;本报告所有绝对数一律采用第一批口径,只有轮次分档、行业病因分组、答案来源这三张表来自第二批,它们引用的都是比例。另有一个原本想用的原因编码字段在两组样本里全为空值,本次未采用。

附录 B 行业范围

本次分析在数据层剔除闲置、拍卖、酒旅三个行业后重新聚合,保留 18 个行业白名单,其中实际有数据的 15 个进入上文各表;白名单内另有 3 个行业在窗口内无数据或轮次过少(不足 5 轮)而未单独列示。所有分母、占比、均值都基于剔除后的样本重算,不是把这三行从表格里隐掉。行业归属按店铺主营类目映射,一店多类目时取权重最高的一个。