Summary
对 10,000 个智能体会话的 Token 消耗分析显示,上下文累积是多轮智能体工作流的主要成本驱动因素。

摘要

对 tikosim 模拟器上 10,000 个匿名智能体会话的分析显示,跨轮次的上下文累积是最大的单一成本驱动因素。由于每轮系统上下文不断增长,20 轮对话会话的成本是 20 个独立单轮请求的 5.2 倍。

关键模式

  • 上下文膨胀:从第 1 轮到第 20 轮,平均会话上下文增长 340%
  • 缓存输入效率:提供缓存读取折扣的提供商可在重复系统提示上节省 40-60%
  • 推理 Token 差异:‘深度思考’配置文件的 Token 消耗标准差是’代码生成’的 8.3 倍
  • 最优模型切换:在首轮规划后从高级推理模型切换到快速模型,可降低 62% 的总成本

建议

智能体构建者应设置每会话 Token 预算,尽可能利用缓存输入,并考虑混合模型策略——常规轮次使用廉价模型,仅在需要时使用昂贵推理模型。