Garden topic
沿着同一个主题回看不同时间留下的线索、问题与修订。
我想把 Agent 的记忆拆成三个可检查的动作,而不是把所有对话扔进向量库。
从人类偏好反馈到 DPO,我想弄清优化目标与真实想要的行为之间会留下多大缝隙。