一个多轮对话功能上线后,调用量没有明显变化,但费用接近翻倍。最初以为是模型切换,后来按请求拆分 token 才发现,每一轮都重复携带了解析后的完整附件。 修复方式是把附件结果做成可引用的摘要与分段检索,同时记录输入、缓存命中和输出 token。这里整理了排查顺序。