01 / Long-form research
Writing
完整记录一个问题如何从直觉变成假设,再穿过实验、工程约束和现实反馈。文章会持续修订,而不是在发布时停止生长。
Agents Need Worlds, Not Just Prompts
通向 AGI 的模型不能只补全下一个 token:它还需要形成关于环境、目标与后果的可更新表征,供 Agent 在长时任务中使用。
Reliable Agent Systems by Design
当 Agent 从单次回答走向长时任务,状态、工具调用、恢复路径和人类协作开始比单轮基准分数更重要。
Mapping Agent Failure Surfaces
用一组小实验追踪 Agent 在工具、记忆、目标和协作边界之外如何退化,并把失败重新写成可验证的假设。
What the Field Adds to Agent Design
一次长时间 Agent 试运行留下的不是漂亮的演示,而是一套关于上下文、权限、工具延迟和协作节奏的现场笔记。