单轮最优与长时可用
Agent 常用单一基准总结表现,但真实工作的可用性来自一组更朴素的约束:稳定的状态更新、可解释的权限边界,以及失败后可预测的恢复路径。
部署前需要把模型拆回系统:上下文截断、工具延迟、队列拥塞、重试策略和人工接管都是 Agent 能力的一部分。
Agent 闭环工程清单
一个可靠的最小闭环包含任务状态、工具权限、超时降级、轨迹记录和回放工具。只有这些基础存在,模型改进才可能被准确归因。
从工具调用到长时任务的状态、恢复与可观测性
Agent 常用单一基准总结表现,但真实工作的可用性来自一组更朴素的约束:稳定的状态更新、可解释的权限边界,以及失败后可预测的恢复路径。
部署前需要把模型拆回系统:上下文截断、工具延迟、队列拥塞、重试策略和人工接管都是 Agent 能力的一部分。
一个可靠的最小闭环包含任务状态、工具权限、超时降级、轨迹记录和回放工具。只有这些基础存在,模型改进才可能被准确归因。