单轮最优与长时可用

Agent 常用单一基准总结表现,但真实工作的可用性来自一组更朴素的约束:稳定的状态更新、可解释的权限边界,以及失败后可预测的恢复路径。

部署前需要把模型拆回系统:上下文截断、工具延迟、队列拥塞、重试策略和人工接管都是 Agent 能力的一部分。

Agent 闭环工程清单

一个可靠的最小闭环包含任务状态、工具权限、超时降级、轨迹记录和回放工具。只有这些基础存在,模型改进才可能被准确归因。