在真实的软件工程长程任务中,“把对话保存到文件”是非常初级的操作。真正决定一个 Agent 工业级可用性的,是它能否在经历长时间中断、程序崩溃或方案推翻重来后,恢复到一个依然能够清醒推进工作的稳健状态:
用户的初始目标有没有被丢弃?
已经发生的关键文件修改和失败的单元测试事实有没有保留?
用户回到 ...
在真实的软件工程长程任务中,Agent 往往需要执行 30 轮甚至 80 轮以上的连续交互。如果每次都将从第 1 轮到当前轮次的完整对话记录全量塞进模型,系统将迅速面临三大灾难:
费用雪崩:随着上下文膨胀至 100k+ Token,单次推理费用呈现指数级增长;
大海捞针困境(Lost in the ...


