TokenCast预测LLM智能体执行期间的Token消耗
TokenCast是一种预测LLM智能体Token消耗的方法。同一任务在不同运行中,消耗量可能相差很大。该方法对各执行阶段的成本及其带来的上下文增长进行建模,并在运行过程中更新预测,无需额外调用LLM。在四个任务套件和六种智能体模型的评测中,与最强对照方法相比,平均绝对误差平均降低14.5%。在离线预算控制回放测试中,在任务完成率相同的情况下,其Token用量比固定预算策略平均减少21.3%。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。