窗口 07-31 至 08-06(7 天)· 全自动与辅助模式两种接待模式全量口径 · 极值会话 9 条逐段还原 + 段级抽样 393 条交叉校验
7 天里有 37,551 轮买家等了 30 秒以上,每 22 轮就有 1 轮。多出来的时长 98% 落在售前主agent这一段,不是某个环节变慢;而且高度集中——大家电一个行业占六成,一家店就占两成。
超过 30 秒的会话平均等待 34,440.3 毫秒,单轮最长 63,125 毫秒。行业与商家两张卡是「谁贡献了这些轮次」的口径(分母是全体超 30 秒),两张接待模式卡是「这种模式自己有多容易超」的口径(分母是该模式总轮次),两类占比不能相加。
逐日从 6.065% 降到 2.22%,说明前期的反思限时动作确实在生效。同时盯住两个行业:家居从 1.74% 到 1.94%、期间峰值 4.43%;汽车流量从 357 轮涨到 2,679 轮,比例在 0.28% 到 2.22% 之间波动,属于正在放量的新行业,需要单独观察。
图中灰柱为当日总轮次(10.5 万至 12.6 万轮,8 月 4 日达峰后小幅回落),蓝色折线为当日超 30 秒占比,含全部接待模式。七天里占比一路单调下行、中间没有一天反弹。
超 30 秒组和 30 秒以内组的异常发生率都是 0。时长分布也不像被掐断:30–40 秒占 87.98%,60 秒以上只有 5 轮,最长 63,125 毫秒。
这些会话是正常跑完的,只是跑得久。
超 30 秒的 26,522 轮里,非文字输入只有 3 轮(都是点击卡片)。图片识别环节虽然在慢组里超 1 秒的比例更高(3.99% 对 1.94%),但它的均值只有 105 毫秒。
这是一个极小的子群,不是主因。
34 个有名字的识别与后处理节点,在一轮超 30 秒的会话里加起来只有 1,252.3 毫秒,只解释 3.52%。增量最大的商品识别节点也只多了 52.3 毫秒。
换句话说,节点级优化这条路,天花板不到一秒。
上面那条曲线不是靠流量摊薄出来的:按店铺分层看,头部 3 家店从 12.63% 降到 5.76%,其余店从 4.17% 降到 1.80%,两侧同时改善,末日大盘 2.2205%。
诚实标注:头部 3 店流量同期从 19,527 轮降到 16,533 轮,其余店从 43,049 轮涨到 64,367 轮,所以大盘那条下降曲线里既有真实改善,也有流量结构位移,两者不能混算。
把一轮的总耗时拆成三段——前置识别(认商品、认订单、判断要不要转人工)、售前主agent(找知识、想答案、写答案)、回复后处理(分场景、贴卡片、发出去)。三段相加等于总耗时(闭合系数 0.9999981)。
一轮多出来的 21.5 秒,98.088% 落在售前主agent这一段——找知识、想答案、写答案。前置识别只多了 198.8 毫秒,回复后处理只多了 57.7 毫秒,两段加起来占增量不到 1.2%。也就是说,能优化的地方只有一处。
| 分段 | 超30秒组均值 | 30秒以内组均值 | 差值 | 倍数 | 占总增量 |
|---|---|---|---|---|---|
| 一轮总耗时 | 35,609.6 ms | 14,126.0 ms | +21,483.6 ms | 2.52× | 100% |
| 售前主agent | 34,092.8 ms | 13,020.0 ms | +21,072.8 ms | 2.62× | 98.088% |
| 前置识别 | 998.7 ms | 799.9 ms | +198.8 ms | 1.25× | 0.925% |
| 回复后处理 | 273.4 ms | 215.7 ms | +57.7 ms | 1.27× | 0.269% |
多出来的 21.5 秒,钱花在哪
橙 0.93% 前置识别 · 蓝 0.27% 回复后处理 · 灰 0.71% 段间调度。售前主agent本身占一轮的 95.74%,且在耗时明细里没有内部拆分,要再往下看只能逐条还原会话日志——下面就是这么做的。
从首轮的 1.916% 到 16 轮以上的 18.137%,翻了 9.5 倍,中间没有任何一档回落。超 30 秒的会话平均已经聊到第 4.88 轮,30 秒以内的只到第 3.02 轮。这条曲线是后面所有动作建议的基础:慢不是随机发生的,是随着对话变深必然发生的。
| 对话进行到第几轮 | 总轮次 | 超30秒轮次 | 超30秒比例 | 该档平均耗时 |
|---|---|---|---|---|
| 第 1 轮 | 182,924 | 3,505 | 1.916% | 9,950 ms |
| 第 2 轮 | 127,818 | 5,741 | 4.492% | 16,646 ms |
| 第 3–4 轮 | 126,333 | 7,563 | 5.987% | 17,808 ms |
| 第 5–8 轮 | 74,369 | 5,841 | 7.854% | 18,745 ms |
| 第 9–15 轮 | 24,128 | 2,957 | 12.255% | 20,494 ms |
| 第 16 轮以上 | 5,045 | 915 | 18.137% | 22,502 ms |
寒暄类在慢组里只占 10.4%,在快组里占 37.2%——快的那一半有三分之一根本不用想答案。而活动咨询是最慢的场景(36,402 毫秒),并且它在慢组里的占比(19.5%)是快组(9.4%)的两倍多,说明活动规则这类知识最容易把机器人拖进长时间思考。
| 买家在问什么 | 超30秒轮次 | 占慢组 | 慢组均值 | 占30秒以内组 | 该组均值 |
|---|---|---|---|---|---|
| 商品咨询 | 15,570 | 57.5% | 35,468 ms | 44.5% | 16,750 ms |
| 活动咨询 | 5,286 | 19.5% | 36,402 ms | 9.4% | 17,422 ms |
| 未识别出诉求(多为寒暄) | 2,827 | 10.4% | 35,023 ms | 37.2% | 9,426 ms |
| 商品推荐 | 2,005 | 7.4% | 35,628 ms | 4.3% | 17,447 ms |
| 售后问题 | 575 | 2.1% | 35,930 ms | 0.9% | 19,141 ms |
| 售前物流 | 461 | 1.7% | 34,461 ms | 2.4% | 16,454 ms |
| 购买操作 | 329 | 1.2% | 35,599 ms | 1.3% | 16,036 ms |
| 发货物流 | 18 | 0.1% | 34,605 ms | 0.05% | 18,478 ms |
等 37.59 秒换来一句兜底知识库agent的回复、等 37.79 秒最后还是转人工,都比机器人自己答完(35.42 秒)更慢。买家付出了最长的等待,拿到的却是最差的结果,这是双重损失。
| 这一轮最后谁给出的答案 | 超30秒轮次 | 慢组均值 | 30秒以内轮次 | 该组均值 | 倍数 |
|---|---|---|---|---|---|
| 售前主agent自己答的 | 23,666 | 35,417 ms | 476,141 | 14,194 ms | 2.49× |
| 兜底知识库agent回复 | 1,219 | 37,591 ms | 4,936 | 12,836 ms | 2.93× |
| 最后还是转了人工 | 1,120 | 37,788 ms | 31,498 | 11,766 ms | 3.21× |
| 转交售后agent | 901 | 35,548 ms | 6,497 | 19,755 ms | 1.80× |
换独立字段交叉验证结论一致:走兜底知识库agent的会话在慢组里 1,257 轮、均值 37,410 ms,在快组里 4,963 轮、均值 12,760 ms。兜底知识库agent的命中率,慢组 5.60% 对快组 1.14%,差 4.9 倍。
每个行业取最慢 1 条、共 9 条(40.4–59.8 秒),全部是全自动接待的纯售前会话,把日志里的子流程按真实起止时刻重排成时间轴。
9 条会话逐条拆开后,慢的原因只有 2 类:一类是答案早就写好了,卡在反思;另一类是一句话 Loop 好几轮才写完。两类都不是环节变慢,而是同一段里被反复执行。
平均主体 50.5 秒。第一版答案平均在第 19.4 秒就已经产出,之后的反思花 12.9–19.8 秒,判定不合格再重写一遍又花 8.1–17.7 秒,买家为此又多等了 31.1 秒。反思加重写合计 26.9 秒,等于主体的 53.4%。
平均主体 44.2 秒,没有反思环节,纯粹是生成轮数多。生成合计占主体的 77%–90%,最极端的汽车那条 48.3 秒、占 90.4%。第 1 轮平均 3,340 毫秒,第 2 轮就跳到 12,519 毫秒,第 3 轮 10,928 毫秒,第 4 轮 8,941 毫秒——第 2 轮起每一轮都是双位数秒。
| 会话 | 行业 | 主体 | 找知识 | 知识排序 | 调工具 | 生成轮数 | 生成合计 | 反思 | 反思后重写 | 首答产出时刻 | 类型 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| T01 | 大家电 | 59.8s | 2.1s | 2.6s | 1.8s | 4 | 31.2s | 15.7s | 8.1s | 22.3s | A 反思重写 |
| T02 | 家居 | 53.6s | 1.4s | 2.1s | 0.0s | 2 | 26.2s | 19.8s | 17.7s | 14.1s | A 反思重写 |
| T03 | 汽车 | 53.4s | 0.6s | 1.1s | 0.0s | 4 | 48.3s | 0.1s | 0.0s | 38.3s | B 多轮 Loop |
| T04 | 文教香氛 | 48.7s | 1.7s | 2.0s | 1.4s | 3 | 21.0s | 19.2s | 7.9s | 20.1s | A 反思重写 |
| T05 | 快消 | 40.5s | 1.2s | 2.2s | 3.3s | 3 | 31.4s | 0.1s | 0.0s | 24.2s | B 多轮 Loop |
| T06 | 宠物 | 42.5s | 1.2s | 1.5s | 4.2s | 4 | 34.9s | 0.1s | 0.0s | 42.0s | B 多轮 Loop |
| T07 | 家装 | 44.2s | 1.6s | 3.0s | 0.0s | 3 | 19.6s | 12.9s | 8.3s | 19.8s | A 反思重写 |
| T08 | 食品生鲜 | 40.4s | 1.3s | 1.1s | 3.8s | 3 | 31.1s | 0.1s | 0.0s | 27.3s | B 多轮 Loop |
| T09 | 玩具潮玩 | 46.0s | 0.6s | 2.3s | 3.6s | 4 | 22.3s | 16.0s | 8.3s | 20.5s | A 反思重写 |
两类会话的共同点:父流程自身的调度空隙只有 1.4–4.3 秒,框架开销可以排除,时间确实花在模型上。另有 3 条会话带主体之外的收尾动作(上下文压缩、会话后主动触达,最长 27.0 秒),它们都在答案发出之后才启动,不算买家等待,如果按账面累加会把等待时长虚高一截。
先看类型 A。家居行业,买家在看压缩袋,问尺寸。
这是一个查规格参数就能答的问题,答案本身也只有一句话。同一通会话往后,买家问到两款电泵的差别:
此后买家消失了 13 分钟,回来时直接甩了两条商品链接,再也没打字提问。
再看类型 B。汽车行业,买家想换一个能线上充值的设备,机器人给了三款让他挑。
最终这条对比答得相当好——三款按使用场景讲清了差别,还反问了跑高速的频率。问题不在质量,在于买家已经先打出了「看不懂」。一个答得对但来得晚的答案,在买家侧和答错的区别不大;而买家在等待期间连发的三条消息,每一条都可能触发新一轮生成,让这一轮变得更慢。
单通会话不能当受控实验看,这两通的作用是让上面的秒数落地成买家的真实体验。会话编号与真实会话标识的对应关系保留在内部版分析文档中。
大家电一个行业就占了全体超 30 秒的 61.28%,自身超 30 秒比例 9.209%,是第二名文教香氛(4.751%)的近两倍。而集中度比比例更值得看:一家大家电店(84,031 轮)贡献了 8,609 轮,占全体超 30 秒的 22.9%;前 3 家店合计 38.4%;前 30 家店合计 65.1%。这意味着大盘指标可以被极少数店铺的链路配置绑架。
| 行业 | 总轮次 | 超30秒轮次 | 超30秒比例 | 占全体超30秒 | 超30秒均值 |
|---|---|---|---|---|---|
| 大家电 | 249,901 | 23,013 | 9.209% | 61.28% | 34,472 ms |
| 文教香氛 | 35,042 | 1,665 | 4.751% | 4.43% | 35,508 ms |
| 宠物 | 62,515 | 2,426 | 3.881% | 6.46% | 33,825 ms |
| 快消 | 200,061 | 6,092 | 3.045% | 16.22% | 34,451 ms |
| 家居 | 17,478 | 504 | 2.884% | 1.34% | 33,598 ms |
| 汽车 | 12,476 | 269 | 2.156% | 0.72% | 33,312 ms |
| 工业品 | 2,852 | 59 | 2.069% | 0.16% | 32,900 ms |
| 食品生鲜 | 54,886 | 983 | 1.791% | 2.62% | 33,601 ms |
| 鲜花园艺 | 8,494 | 142 | 1.672% | 0.38% | 31,901 ms |
| 玩具潮玩 | 40,345 | 669 | 1.658% | 1.78% | 34,678 ms |
| 黄金饰品 | 47,752 | 602 | 1.261% | 1.60% | 33,966 ms |
| 家装 | 87,051 | 1,036 | 1.190% | 2.76% | 35,525 ms |
| 数字生活 | 7,550 | 77 | 1.020% | 0.21% | 33,560 ms |
| 商业农业 | 2,214 | 12 | 0.542% | 0.03% | 33,358 ms |
| 个性定制 | 1,292 | 2 | 0.155% | 0.005% | 34,192 ms |
全自动侧 4.9394%、辅助模式侧 3.7184%,两者只差 1.2 个百分点,模式本身解释不了什么。真正的反差在行业内部:家装的全自动侧超 30 秒比例 6.561%,辅助模式侧只有 0.0335%,相差 196 倍,说明家装这两条链路的配置差异极大;汽车正好相反,辅助模式侧 4.403% 高于全自动侧 1.474%;玩具潮玩与黄金饰品的辅助模式侧一条都没有。
| 接待模式 | 总轮次 | 超30秒轮次 | 超30秒比例 | 超30秒均值 | 单轮最长 |
|---|---|---|---|---|---|
| 全自动 | 548,068 | 27,071 | 4.9394% | 35,609.6 ms | 63,125 ms |
| 辅助模式 | 281,844 | 10,480 | 3.7184% | 31,419.7 ms | 37,574 ms |
| 合计 | 829,912 | 37,551 | 4.5247% | 34,440.3 ms | 63,125 ms |
超 30 秒会话的时长分档(合计 37,551 轮)
60–90 秒仅 5 轮,90 秒以上 0 轮。辅助模式的 10,480 轮全部落在 30–40 秒档,也就是说 40 秒以上的 4,513 轮全部来自全自动侧。
大盘慢组的兜底知识库命中率 5.60% 是基准线。汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活五个行业都在 10% 以上,鲜花园艺与家居次之,这些行业的慢是「找不到答案所以反复想」;文教香氛、大家电、家装、家居、快消、宠物的平均轮次都在 4.25 以上,这些行业的慢是「上下文越堆越长、生成轮数越来越多」。家居两头都占。
| 行业 | 慢组平均轮次 | 快组平均轮次 | 慢组兜底知识库命中率 | 快组命中率 | 病因 |
|---|---|---|---|---|---|
| 文教香氛 | 5.36 | 3.25 | 5.96% | 0.74% | 聊得深 |
| 大家电 | 5.33 | 3.43 | 4.69% | 1.33% | 聊得深(且是量级担当) |
| 家装 | 4.90 | 3.46 | 5.73% | 1.21% | 聊得深 |
| 家居 | 4.89 | 3.01 | 7.39% | 1.00% | 聊得深 + 知识不够 |
| 玩具潮玩 | 4.66 | 3.04 | 13.22% | 1.75% | 知识不够 |
| 快消 | 4.25 | 2.88 | 5.38% | 1.28% | 聊得深 |
| 汽车 | 3.91 | 2.90 | 13.48% | 0.83% | 知识不够 |
| 宠物 | 3.91 | 2.87 | 5.30% | 0.80% | 聊得深 |
| 工业品 | 3.87 | 2.87 | 4.35% | 0.97% | 样本过小,不下结论 |
| 食品生鲜 | 3.41 | 2.51 | 10.92% | 0.58% | 知识不够 |
| 黄金饰品 | 3.27 | 2.44 | 11.04% | 0.50% | 知识不够 |
| 鲜花园艺 | 3.15 | 3.24 | 7.69% | 0.64% | 知识不够 |
| 数字生活 | 3.06 | 2.65 | 10.45% | 2.36% | 知识不够 |
目前的反思环节没有触发条件也没有时间上限,实测花 12.9–19.8 秒,判定不合格后的重写再花 8.1–17.7 秒——而第一版答案在第 19.4 秒就已经存在。建议同一 trace 内只允许反思 1 次,不再反复复查同一条答案;同时只在第 1 轮以及命中关键风险词时开启反思,并给「反思 + 重写」设一个合计硬预算(建议 6 秒),超预算直接把已有的第一版答案发出去。这一项直接命中 9 条极值里的 5 条,预计能砍掉这类会话主体时长的 30%–50%。
轮次曲线已经说明第 2 轮 Loop 起每一轮都是双位数秒,而超 30 秒比例从首轮 1.916% 单调涨到 16 轮以上的 18.137%。建议对话进行到第 5 轮起不再启用第 3 轮 Loop,第 9 轮起不再启用第 2 轮 Loop,并按轮次窗口截断带进模型的上下文。这不是降级,是让深聊会话别越聊越等。
9 条极值会话的 Loop 都跑了 3–4 轮,其中工具调用最多的一条花掉 4.2 秒——同一轮对话里,同一个工具很可能被反复调了几遍。建议在链路侧加一条约束:同一 trace 内同一工具只允许调用一次,出参在本轮内缓存复用,后续 Loop 直接取缓存而不是重新发起。
第一组是聊得深的行业:大家电、文教香氛、家装、家居、快消、宠物。这几个行业的病不是知识不够,动作应该落在上下文窗口治理和 Loop 轮数预算上。大家电还要单独做店铺专项——一家店占全体超 30 秒的 22.9%、前 3 家占 38.4%,先把这 3 家的 Loop 轮数上限和反思开关调一遍,收益比任何全局改动都大,而且不影响其他行业。
第二组是知识不够的行业:汽车、玩具潮玩、黄金饰品、食品生鲜、数字生活、鲜花园艺。这几个行业的病是找不到知识、于是反复想、最后转给兜底知识库agent回复,而这条路径的均值 37,591 毫秒是所有答案来源里最慢的。动作有两个:一是补知识,优先级最高的是活动规则(活动咨询是最慢场景 36,402 毫秒,且在慢组里的占比是快组的两倍多),其次是商品咨询里的规格与适配类;二是给这条路径设硬预算,一旦确定要由兜底知识库agent回复,就不要再触发重写。
按需求随机抽取每个行业 30 条做段级校验,实际抽中 393 条、覆盖 15 个行业、79 家店(行业轮次不足 30 条的按实际抽满)。抽样样本的售前主agent占比中位数 0.959,三段相加与总耗时的最差偏差 1 毫秒,说明分段口径在样本上同样成立。抽样里最慢的是文教香氛(中位 36.66 秒),最快的是黄金饰品(32.90 秒)。9 条逐条还原的极值会话就是从这批样本里按每行业最慢一条挑出来的。
有一处取数批次差异需要交代:耗时明细只保留 7 天,前后两批任务相隔约 1 小时提交,最早一天的分区在此期间开始过期,因此第二批的样本量比第一批小 2.0%(全自动售前 540,617 轮对 548,068 轮)。占比类指标不受影响;本报告所有绝对数一律采用第一批口径,只有轮次分档、行业病因分组、答案来源这三张表来自第二批,它们引用的都是比例。另有一个原本想用的原因编码字段在两组样本里全为空值,本次未采用。
本次分析在数据层剔除闲置、拍卖、酒旅三个行业后重新聚合,保留 18 个行业白名单,其中实际有数据的 15 个进入上文各表;白名单内另有 3 个行业在窗口内无数据或轮次过少(不足 5 轮)而未单独列示。所有分母、占比、均值都基于剔除后的样本重算,不是把这三行从表格里隐掉。行业归属按店铺主营类目映射,一店多类目时取权重最高的一个。