01 / Long-form research

Writing

完整记录一个问题如何从直觉变成假设,再穿过实验、工程约束和现实反馈。文章会持续修订,而不是在发布时停止生长。

Theory
2026 · 14 min

Agents Need Worlds, Not Just Prompts

通向 AGI 的模型不能只补全下一个 token:它还需要形成关于环境、目标与后果的可更新表征,供 Agent 在长时任务中使用。

Engineering
2026 · 11 min

Reliable Agent Systems by Design

当 Agent 从单次回答走向长时任务,状态、工具调用、恢复路径和人类协作开始比单轮基准分数更重要。

Research Note
2026 · 7 min

Mapping Agent Failure Surfaces

用一组小实验追踪 Agent 在工具、记忆、目标和协作边界之外如何退化,并把失败重新写成可验证的假设。

Field Log
2026 · 9 min

What the Field Adds to Agent Design

一次长时间 Agent 试运行留下的不是漂亮的演示,而是一套关于上下文、权限、工具延迟和协作节奏的现场笔记。