窗口 08-01 至 08-06(6 天)· 全自动与辅助模式两种接待模式全量口径 · 极值会话 9 条逐段还原 + 段级抽样 355 条交叉校验
问题有多大:6 天里有 31,192 轮买家等了 30 秒以上,每 23 轮就有 1 轮;逐日占比已从 5.73% 收敛到 2.22%,但剩下的部分高度集中——大家电一个行业占六成、两家店占近一半,是链路配置层面的结构性问题,不动配置不会自己消失。
根因是什么:多出来的时长 98% 落在售前主agent;把 240 条会话的时间轴拆开,多等的 22.57 秒里六成花在想答案、写答案,反思复核再占 8.90%。大模型不是单次变慢,而是被调用的次数变多:慢组 58.33% 的轮次调了 3 次以上大模型,30 秒以内组只有 6.67%;工具与知识检索合计只解释约两成。
怎么解决、收益多少:四条动作——反思限 1 次并限时、Loop 轮数随对话深度递减、同工具调用去重、按行业分组配链路(含大家电两店专项)。按 240 条抽样模拟测算,前三条链路动作做完,慢组有 23.33%(保守)~64.17%(积极)的轮次可压回 30 秒以内,超 30 秒占比预计从 4.30% 降到 3.30%(保守)~1.54%(积极),测算口径见第五章收益一览。
超过 30 秒的会话平均等待 34,454.3 毫秒,单轮最长 60,745 毫秒。行业与商家两张卡是「谁贡献了这些轮次」的口径(分母是全体超 30 秒),两张接待模式卡是「这种模式自己有多容易超」的口径(分母是该模式总轮次),两类占比不能相加。
逐日从 5.73% 降到 2.22%,六天单调下行、没有一天反弹,说明前期的反思限时动作确实在生效。分行业看则没有这么干净:文教香氛 08-04 到 08-05 从 3.98% 回到 4.82%、快消从 3.05% 回到 3.79%,当天有小幅反复;汽车流量从 387 轮涨到 2,679 轮(近 7 倍),比例在 0.45% 到 2.22% 之间摆动,属于正在放量的新行业,需要单独观察。
图中灰柱为当日总轮次(11.7 万至 12.6 万轮,8 月 4 日达峰后小幅回落),蓝色折线为当日超 30 秒占比,含全部接待模式。六天里占比一路单调下行、中间没有一天反弹。
超 30 秒组和 30 秒以内组的异常发生率都是 0。时长分布也不像被掐断:30–40 秒占 87.97%,60 秒以上只有 3 轮,最长 60,745 毫秒。
这些会话是正常跑完的,只是跑得久。
超 30 秒的 22,808 轮里,非文字输入只有 2 轮(都是点击卡片)。图片识别环节虽然在慢组里超 1 秒的比例更高(4.16% 对 1.92%),但它的均值只有 109 毫秒。
这是一个极小的子群,不是主因。
34 个有名字的识别与后处理节点,在一轮超 30 秒的会话里加起来只有 1,259.2 毫秒,只解释 3.54%。增量最大的商品识别节点也只多了 52.7 毫秒。
换句话说,节点级优化这条路,天花板不到一秒。
上面那条曲线不是靠流量摊薄出来的:按店铺分层看,头部 3 家店从 11.09% 降到 5.76%,其余店从 4.32% 降到 1.80%,两侧同时改善,末日大盘 2.22%。
诚实标注:头部 3 店流量同期从 23,013 轮降到 16,533 轮,其余店从 52,646 轮涨到 64,367 轮,所以大盘那条下降曲线里既有真实改善,也有流量结构位移,两者不能混算。
把一轮的总耗时拆成三段——前置识别(认商品、认订单、判断要不要转人工)、售前主agent(找知识、想答案、写答案)、回复后处理(分场景、贴卡片、发出去)。三段相加等于总耗时(闭合系数 0.9999985)。
一轮多出来的 21.5 秒,97.96% 落在售前主agent这一段——找知识、想答案、写答案。前置识别只多了 203.7 毫秒,回复后处理只多了 60.6 毫秒,两段加起来占增量不到 1.25%。也就是说,能优化的地方只有一处。
| 分段 | 超30秒组均值 | 30秒以内组均值 | 差值 | 倍数 | 占总增量 |
|---|---|---|---|---|---|
| 一轮总耗时 | 35,568.2 ms | 14,026.1 ms | +21,542.1 ms | 2.54× | 100% |
| 售前主agent | 34,024.4 ms | 12,921.9 ms | +21,102.5 ms | 2.63× | 97.96% |
| 前置识别 | 1,003.2 ms | 799.5 ms | +203.7 ms | 1.25× | 0.95% |
| 回复后处理 | 276.0 ms | 215.4 ms | +60.6 ms | 1.28× | 0.28% |
多出来的 21.5 秒,钱花在哪
橙 0.95% 前置识别 · 蓝 0.28% 回复后处理 · 灰 0.81% 段间调度。售前主agent本身占一轮的 95.66%,且在耗时明细里没有内部拆分,要再往下看只能逐条还原会话日志——下面就是这么做的。
从首轮的 1.82% 到 16 轮以上的 17.31%,翻了 9.5 倍,中间没有任何一档回落。超 30 秒的会话平均已经聊到第 4.88 轮,30 秒以内的只到第 3.02 轮。这条曲线是后面所有动作建议的基础:慢不是随机发生的,是随着对话变深必然发生的。
| 对话进行到第几轮 | 总轮次 | 超30秒轮次 | 超30秒比例 | 该档平均耗时 |
|---|---|---|---|---|
| 第 1 轮 | 164,837 | 2,999 | 1.82% | 9,871 ms |
| 第 2 轮 | 115,038 | 4,959 | 4.31% | 16,521 ms |
| 第 3–4 轮 | 113,186 | 6,552 | 5.79% | 17,687 ms |
| 第 5–8 轮 | 66,302 | 5,000 | 7.54% | 18,592 ms |
| 第 9–15 轮 | 21,542 | 2,502 | 11.61% | 20,244 ms |
| 第 16 轮以上 | 4,599 | 796 | 17.31% | 22,347 ms |
寒暄类在慢组里只占 10.37%,在快组里占 37.24%——快的那一半有三分之一根本不用想答案。而活动咨询是最慢的场景(36,284 毫秒),并且它在慢组里的占比(19.56%)是快组(9.48%)的两倍多,说明活动规则这类知识最容易把机器人拖进长时间思考。
| 买家在问什么 | 超30秒轮次 | 占慢组 | 慢组均值 | 占30秒以内组 | 该组均值 |
|---|---|---|---|---|---|
| 商品咨询 | 13,086 | 57.37% | 35,442 ms | 44.40% | 16,646 ms |
| 活动咨询 | 4,461 | 19.56% | 36,284 ms | 9.48% | 17,291 ms |
| 未识别出诉求(多为寒暄) | 2,366 | 10.37% | 35,013 ms | 37.24% | 9,350 ms |
| 商品推荐 | 1,720 | 7.54% | 35,660 ms | 4.25% | 17,368 ms |
| 售后问题 | 494 | 2.17% | 35,786 ms | 0.88% | 19,011 ms |
| 售前物流 | 382 | 1.67% | 34,495 ms | 2.36% | 16,338 ms |
| 购买操作 | 288 | 1.26% | 35,289 ms | 1.34% | 15,950 ms |
| 发货物流 | 11 | 0.05% | 35,119 ms | 0.05% | 18,172 ms |
等 37.49 秒换来一句兜底知识库agent的回复、等 37.65 秒最后还是转人工,都比机器人自己答完(35.37 秒)更慢。买家付出了最长的等待,拿到的却是最差的结果,这是双重损失。
| 这一轮最后谁给出的答案 | 超30秒轮次 | 慢组均值 | 30秒以内轮次 | 该组均值 | 倍数 |
|---|---|---|---|---|---|
| 售前主agent自己答的 | 19,799 | 35,373 ms | 423,402 | 14,085 ms | 2.51× |
| 兜底知识库agent回复 | 1,094 | 37,491 ms | 4,234 | 13,158 ms | 2.85× |
| 最后还是转了人工 | 992 | 37,650 ms | 27,792 | 11,763 ms | 3.20× |
| 转交售后agent | 923 | 35,243 ms | 7,268 | 19,771 ms | 1.78× |
换独立字段交叉验证结论一致:兜底知识库agent的命中率,慢组 5.94%(1,354 轮)对快组 1.11%(5,135 轮),差 5.3 倍。这个字段与上表的答案来源字段各自独立记录,两边都指向同一件事——答不上来的那部分,恰好也是等得最久的那部分。
每个行业取最慢 1 条、共 9 条(38.5–53.6 秒),全部是全自动接待的纯售前会话,把日志里的子流程按真实起止时刻重排成时间轴。
9 条会话逐条拆开后,慢的原因只有 2 类:一类是答案早就写好了,卡在反思;另一类是一句话 Loop 好几轮才写完。两类都不是环节变慢,而是同一段里被反复执行。
平均主体 46.8 秒。第一版答案平均在第 17.3 秒就已经产出,之后的反思花 12.9–19.8 秒,判定不合格再重写一遍又花 6.8–17.7 秒,买家为此又多等了 29.4 秒。反思加重写合计 27.4 秒,等于主体的 58.60%。
平均主体 42.6 秒,没有反思环节,纯粹是生成轮数多。生成合计占主体的 65%–90%,最极端的汽车那条 48.3 秒、占 90.40%。第 1 轮平均 4,486 毫秒,第 2 轮就跳到 12,149 毫秒,第 3 轮 10,415 毫秒,第 4 轮 9,953 毫秒——第 2 轮起每一轮都是双位数秒。
| 会话 | 行业 | 主体 | 找知识 | 知识排序 | 调工具 | 生成轮数 | 生成合计 | 反思 | 反思后重写 | 首答产出时刻 | 类型 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| T01 | 大家电 | 40.6s | 0.9s | 2.0s | 0.0s | 3 | 16.9s | 17.0s | 6.8s | 15.2s | A 反思重写 |
| T02 | 家居 | 53.6s | 1.4s | 2.1s | 0.0s | 2 | 26.2s | 19.8s | 17.7s | 14.1s | A 反思重写 |
| T03 | 汽车 | 53.4s | 0.6s | 1.1s | 0.0s | 4 | 48.3s | 0.1s | 0.0s | 38.3s | B 多轮 Loop |
| T04 | 文教香氛 | 48.7s | 1.7s | 2.0s | 1.4s | 3 | 21.0s | 19.2s | 7.9s | 20.1s | A 反思重写 |
| T05 | 快消 | 40.5s | 1.2s | 2.2s | 3.3s | 3 | 31.4s | 0.1s | 0.0s | 24.2s | B 多轮 Loop |
| T06 | 宠物 | 40.2s | 0.6s | 1.4s | 0.0s | 3 | 26.3s | 0.0s | 0.0s | — | B 多轮 Loop |
| T07 | 家装 | 44.2s | 1.6s | 3.0s | 0.0s | 3 | 19.6s | 12.9s | 8.3s | 19.8s | A 反思重写 |
| T08 | 食品生鲜 | 40.4s | 1.3s | 1.1s | 3.8s | 3 | 31.1s | 0.1s | 0.0s | 27.3s | B 多轮 Loop |
| T09 | 玩具潮玩 | 38.5s | 0.6s | 1.7s | 1.6s | 4 | 32.4s | 0.0s | 0.0s | — | B 多轮 Loop |
首答产出时刻以反思启动时刻定位;宠物与玩具潮玩两条完全没有触发反思,无法定位首答时刻,记为「—」。两类会话的共同点:父流程自身的调度空隙 9 条里有 8 条只有 1.3–4.3 秒,只有宠物那条达到 10.9 秒,框架开销总体可以排除,时间确实花在模型上。另有 4 条会话带主体之外的收尾动作(上下文压缩、会话后主动触达,最长 27.0 秒),它们都在答案发出之后才启动,不算买家等待,如果按账面累加会把等待时长虚高一截。
上面 9 条是各行业的最慢极值,只能定性。这里再随机抽 240 条真实会话——超 30 秒的 120 条、30 秒以内的 120 条——把每条的时间轴按环节归类,同一个环节在两组之间差多少,一目了然。
慢组的售前主agent墙钟均值 32,737 毫秒,30 秒以内组 10,170 毫秒,多等的 22.57 秒里 60.22% 被想答案、写答案这一步吃掉,反思复核再吃 8.90%,两项合计近七成。而且大模型不是单次变慢,是被叫的次数变多——慢组有 58.33% 的轮次调了 3 次以上,30 秒以内组只有 6.67%。真正意义上的工具(调工具、商品推荐工具)加起来只解释 11.94% 的增量,且差别主要在命中率而非单次快慢:调工具在慢组 45.83% 的轮次里出现,在 30 秒以内组只有 11.67%,单次耗时却只差 1.53 倍。找知识和知识排序更不是瓶颈,两项合计在慢组 5.75 秒、在 30 秒以内组 3.99 秒,只多了 1.76 秒,合起来只解释 8.38% 的增量;它们在 30 秒以内组占主体的 43.04%,到了慢组反而只剩 17.57%——不是它们变慢了,是分母被写答案撑大了。
| 这一轮调了什么 | 慢组命中轮次 | 占慢组 | 慢组均值 | 占30秒以内组 | 该组均值 |
|---|---|---|---|---|---|
| 想答案、写答案 | 114 | 95.00% | 19,859 ms | 85.00% | 6,208 ms |
| 调工具 | 55 | 45.83% | 4,377 ms | 11.67% | 2,863 ms |
| 反思复核 | 93 | 77.50% | 3,874 ms | 65.83% | 1,510 ms |
| 商品推荐工具 | 48 | 40.00% | 3,376 ms | 17.50% | 1,879 ms |
| 知识排序 | 109 | 90.83% | 3,278 ms | 83.33% | 2,376 ms |
| 找知识 | 110 | 91.67% | 2,473 ms | 85.00% | 1,617 ms |
| 转人工判定(答案写完后) | 111 | 92.50% | 1,074 ms | 70.83% | 480 ms |
| 会话摘要 | 15 | 12.50% | 1,030 ms | 10.00% | 1,005 ms |
| 答案定稿加工 | 100 | 83.33% | 714 ms | 65.00% | 483 ms |
| 看图找货与图文作答 | 88 | 73.33% | 416 ms | 62.50% | 295 ms |
| 准入校验 | 108 | 90.00% | 357 ms | 85.00% | 314 ms |
| 拒答判定 | 96 | 80.00% | 265 ms | 73.33% | 150 ms |
| 配置解析 | 109 | 90.83% | 130 ms | 69.17% | 116 ms |
本模块口径与全篇不同,需单独看:耗时明细底表只保留最近 7 天,全报告首日的分区已过期不可回溯,因此这 240 条抽自 08-02 至 08-06 五天,其余章节仍是全篇的六天全量。五天口径下超 30 秒 21,700 轮、30 秒以内 537,118 轮,抽样与总体在行业、接待模式两个维度上的最大偏差为慢组行业 3.11 个百分点、慢组接待模式 1.85 个百分点、30 秒以内组行业 4.86 个百分点、接待模式 6.37 个百分点,都落在 120 条抽样的正常波动内;慢组抽样覆盖 34 家店、会话均值 34,612 毫秒,30 秒以内组覆盖 43 家店、均值 12,020 毫秒。「占慢组」是命中率(该轮至少调用一次),不是构成占比,各行相加不等于 100%;「均值」指命中轮次内该环节多次调用的累计耗时再取平均,因此想答案、写答案一行的 19,859 毫秒已含同一轮里的多次调用。各行不能直接相加当买家等待:主体结束后才启动的上下文压缩与会话后主动触达已全部剔除,另有 13 处环节存在时间区间嵌套、仅占 4,678 条时间轴记录的 0.28%,可忽略。表内 13 个具名环节合计解释了两组主体墙钟差额的 94.99%,剩余 5.01% 是父流程自身的调度空隙。
先看类型 A。家居行业,买家在看压缩袋,问尺寸。
这是一个查规格参数就能答的问题,答案本身也只有一句话。同一通会话往后,买家问到两款电泵的差别:
此后买家消失了 13 分钟,回来时直接甩了两条商品链接,再也没打字提问。
再看类型 B。汽车行业,买家想换一个能线上充值的设备,机器人给了三款让他挑。
最终这条对比答得相当好——三款按使用场景讲清了差别,还反问了跑高速的频率。问题不在质量,在于买家已经先打出了「看不懂」。一个答得对但来得晚的答案,在买家侧和答错的区别不大;而买家在等待期间连发的三条消息,每一条都可能触发新一轮生成,让这一轮变得更慢。
单通会话不能当受控实验看,这两通的作用是让上面的秒数落地成买家的真实体验。会话编号与真实会话标识的对应关系保留在内部版分析文档中。
大家电一个行业就占了全体超 30 秒的 60.50%,自身超 30 秒比例 8.86%,是第二名文教香氛(4.67%)的近两倍。而集中度比比例更值得看:两家大家电旗舰店分别贡献 7,180 轮和 7,169 轮,各自就占全体超 30 秒的 23% 上下,两家合计 46.00%;前 3 家店合计 51.17%;前 30 家店合计 87.91%。这意味着大盘指标可以被极少数店铺的链路配置绑架。
| 行业 | 总轮次 | 超30秒轮次 | 超30秒比例 | 占全体超30秒 | 超30秒均值 |
|---|---|---|---|---|---|
| 大家电 | 212,969 | 18,870 | 8.86% | 60.50% | 34,487 ms |
| 文教香氛 | 30,943 | 1,444 | 4.67% | 4.63% | 35,578 ms |
| 宠物 | 53,009 | 1,901 | 3.59% | 6.09% | 33,838 ms |
| 家居 | 16,103 | 475 | 2.95% | 1.52% | 33,679 ms |
| 快消 | 175,838 | 5,138 | 2.92% | 16.47% | 34,454 ms |
| 工业品 | 2,550 | 59 | 2.31% | 0.19% | 32,900 ms |
| 汽车 | 11,650 | 257 | 2.21% | 0.82% | 33,364 ms |
| 鲜花园艺 | 7,478 | 128 | 1.71% | 0.41% | 31,948 ms |
| 食品生鲜 | 49,826 | 835 | 1.68% | 2.68% | 33,634 ms |
| 玩具潮玩 | 35,486 | 573 | 1.61% | 1.84% | 34,635 ms |
| 家装 | 77,066 | 925 | 1.20% | 2.97% | 35,496 ms |
| 黄金饰品 | 42,297 | 501 | 1.18% | 1.61% | 33,840 ms |
| 数字生活 | 6,799 | 73 | 1.07% | 0.23% | 33,609 ms |
| 商业农业 | 1,988 | 11 | 0.55% | 0.04% | 33,645 ms |
| 个性定制 | 1,058 | 2 | 0.19% | 0.01% | 34,192 ms |
全自动侧 4.70%、辅助模式侧 3.50%,两者只差 1.2 个百分点,模式本身解释不了什么。真正的反差在行业内部:家装的全自动侧超 30 秒比例 6.33%,辅助模式侧只有 0.04%,相差 166 倍,说明家装这两条链路的配置差异极大;汽车正好相反,辅助模式侧 4.80% 高于全自动侧 1.52%;玩具潮玩与黄金饰品的辅助模式侧一条都没有。
| 接待模式 | 总轮次 | 超30秒轮次 | 超30秒比例 | 超30秒均值 | 单轮最长 |
|---|---|---|---|---|---|
| 全自动 | 485,492 | 22,808 | 4.70% | 35,568.2 ms | 60,745 ms |
| 辅助模式 | 239,570 | 8,384 | 3.50% | 31,424.1 ms | 37,574 ms |
| 合计 | 725,062 | 31,192 | 4.30% | 34,454.3 ms | 60,745 ms |
超 30 秒会话的时长分档(合计 31,192 轮)
60–90 秒仅 3 轮,90 秒以上 0 轮。辅助模式的 8,384 轮全部落在 30–40 秒档,也就是说 40 秒以上的 3,752 轮全部来自全自动侧。
大盘慢组的兜底知识库命中率 5.94% 是基准线。玩具潮玩、汽车、食品生鲜、黄金饰品、数字生活五个行业都在 10% 以上,鲜花园艺与家居次之,这些行业的慢是「找不到答案所以反复想」;大家电、文教香氛、家居、家装、玩具潮玩、快消的平均轮次都在 4.25 以上,这些行业的慢是「上下文越堆越长、生成轮数越来越多」。家居与玩具潮玩两头都占。
| 行业 | 慢组平均轮次 | 快组平均轮次 | 慢组兜底知识库命中率 | 快组命中率 | 病因 |
|---|---|---|---|---|---|
| 大家电 | 5.34 | 3.43 | 4.90% | 1.28% | 聊得深(且是量级担当) |
| 文教香氛 | 5.19 | 3.27 | 6.37% | 0.76% | 聊得深 |
| 家居 | 4.95 | 3.03 | 7.08% | 1.02% | 聊得深 + 知识不够 |
| 家装 | 4.88 | 3.47 | 6.33% | 1.28% | 聊得深 |
| 玩具潮玩 | 4.76 | 3.02 | 13.79% | 1.76% | 知识不够 + 聊得深 |
| 快消 | 4.27 | 2.88 | 5.63% | 1.21% | 聊得深 |
| 汽车 | 3.92 | 2.91 | 13.57% | 0.83% | 知识不够 |
| 宠物 | 3.88 | 2.85 | 6.14% | 0.75% | 聊得深(偏轻) |
| 工业品 | 3.87 | 2.88 | 4.35% | 0.97% | 样本过小,不下结论 |
| 食品生鲜 | 3.52 | 2.52 | 11.78% | 0.60% | 知识不够 |
| 鲜花园艺 | 3.30 | 3.09 | 8.70% | 0.70% | 知识不够 |
| 黄金饰品 | 3.22 | 2.44 | 11.78% | 0.51% | 知识不够 |
| 数字生活 | 3.13 | 2.69 | 10.94% | 2.49% | 知识不够 |
目前的反思环节没有触发条件也没有时间上限,实测花 12.9–19.8 秒,判定不合格后的重写再花 6.8–17.7 秒——而第一版答案在第 17.3 秒就已经存在。建议同一 trace 内只允许反思 1 次,不再反复复查同一条答案;同时只在第 1 轮以及命中关键风险词时开启反思,并给「反思 + 重写」设一个合计硬预算(建议 6 秒),超预算直接把已有的第一版答案发出去。这一项直接命中 9 条极值里的 4 条,预计能砍掉这类会话主体时长的 30%–50%。按 240 条抽样模拟,仅「反思限时 6 秒」一项就影响慢组 20 条轮次、受影响轮次平均省 6.1 秒,单项即可把 120 条里的 13 条(10.83%)压回 30 秒以内。
轮次曲线已经说明第 2 轮 Loop 起每一轮都是双位数秒,而超 30 秒比例从首轮 1.82% 单调涨到 16 轮以上的 17.31%。建议对话进行到第 5 轮起不再启用第 3 轮 Loop,第 9 轮起不再启用第 2 轮 Loop,并按轮次窗口截断带进模型的上下文。这不是降级,是让深聊会话别越聊越等。按 240 条抽样模拟:只封第 4 轮及以上 Loop(保守)影响慢组 20 条、单项压回 13 条;封顶到 2 轮(积极)影响 70 条、受影响轮次平均省 11.6 秒、单项压回 64 条(53.33%)——四条动作里单项收益最大的就是它,也是唯一能把大盘占比砍掉一半以上的一条。
9 条极值会话的 Loop 跑了 2–4 轮,其中工具调用最多的一条花掉 3.8 秒——同一轮对话里,同一个工具很可能被反复调了几遍。建议在链路侧加一条约束:同一 trace 内同一工具只允许调用一次,出参在本轮内缓存复用,后续 Loop 直接取缓存而不是重新发起。按 240 条抽样模拟,同名工具去重影响慢组 11 条、受影响轮次平均省 6.1 秒、单项压回 4 条;单看量不大,但它与前两条叠加时能把贴线轮次推过 30 秒线,而且实现成本最低。
第一组是聊得深的行业:大家电、文教香氛、家装、家居、快消、玩具潮玩。这几个行业的病主要不是知识不够,动作应该落在上下文窗口治理和 Loop 轮数预算上。大家电还要单独做店铺专项——两家店合计占全体超 30 秒的 46.00%、前 3 家占 51.17%,先把这 3 家的 Loop 轮数上限和反思开关调一遍,收益比任何全局改动都大,而且不影响其他行业。
第二组是知识不够的行业:汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活、鲜花园艺。这几个行业的病是找不到知识、于是反复想、最后转给兜底知识库agent回复,而这条路径的均值 37,491 毫秒是所有答案来源里最慢的。动作有两个:一是补知识,优先级最高的是活动规则(活动咨询是最慢场景 36,284 毫秒,且在慢组里的占比是快组的两倍多),其次是商品咨询里的规格与适配类;二是给这条路径设硬预算,一旦确定要由兜底知识库agent回复,就不要再触发重写。
按 240 条抽样做「直接扣除」模拟:三条链路动作叠加,保守档(生成只封第 4 轮及以上)可把慢组 23.33% 的轮次压回 30 秒以内,大盘超 30 秒占比从 4.30% 降到 3.30%;积极档(生成封顶 2 轮)可压回 64.17%,大盘降到 1.54%。收益主要来自生成封顶,反思限时与工具去重是护航项。积极档动作更狠,需要先用答案质量与转化指标做 AB 护栏,再决定全量。
| 动作 | 影响面(慢组) | 单项压回30秒内 | 受影响轮次平均省时 | 责任方 | 节奏 |
|---|---|---|---|---|---|
| 反思限 1 次并限时 6 秒 | 77.50% 轮次带反思复核 | 13 / 120 | 6.1 秒 | 链路配置 | 当周可灰度 |
| Loop 轮数随对话深度递减 | 58.33% 轮次生成 3 次以上 | 13–64 / 120 | 7.7–11.6 秒 | 链路配置 + 算法 | 1–2 周 AB |
| 同 trace 同工具只调 1 次 | 45.83% 轮次有工具调用 | 4 / 120 | 6.1 秒 | 链路配置 | 当周可灰度 |
| 按行业分组配链路 + 两店专项 | 两家店占全体 46.00% | 放大前三条收益 | — | 行业运营 + 商家 | 2–4 周 |
| 三条链路动作叠加 | — | 28–77 / 120 | 9.0–12.2 秒 | — | — |
模拟口径:在 240 条抽样(超 30 秒 120 条)的真实时间轴上把动作规则直接套用——反思每次封顶 6 秒、答案生成每轮对话只保留前 3 轮(保守)或前 2 轮(积极)、同名工具的重复调用去掉——省下的毫秒数从该轮总耗时里直接扣除,再看有多少条落回 30 秒以内。三个假设需要交代:环节按串行处理,砍掉的调用不影响剩余环节的耗时;未计入上下文变短带来的额外提速(这一点偏保守);也未计入答案质量的变化(需要 AB 验证)。各单项的压回条数相加不等于叠加值,因为同一条轮次可能被多条动作同时命中。
按需求随机抽取每个行业 30 条做段级校验,落在本窗口的共 355 条、覆盖 15 个行业、75 家店(行业轮次不足 30 条的按实际抽满)。抽样样本的售前主agent占比中位数 0.969,三段相加与总耗时的最差偏差 1 毫秒,说明分段口径在样本上同样成立。抽样里最慢的是文教香氛(中位 37.53 秒),最快的是宠物(31.96 秒)。
9 条逐条还原的极值会话就是从这批样本里按每行业最慢一条挑出来的,有一条需要交代:玩具潮玩行业最慢的那条是视频输入、且中途转了人工,与「全部为全自动接待的纯售前文字会话」的口径不符,因此顺延取该行业第二慢的一条(41.3 秒)。另有一个原本想用的原因编码字段在两组样本里全为空值,本次未采用。
本次分析在数据层剔除闲置、拍卖、酒旅三个行业后重新聚合,保留 18 个行业白名单,其中实际有数据的 15 个进入上文各表;白名单内另有 3 个行业在窗口内无数据或轮次过少(不足 5 轮)而未单独列示。所有分母、占比、均值都基于剔除后的样本重算,不是把这三行从表格里隐掉。行业归属按店铺主营类目映射,一店多类目时取权重最高的一个。