一条链路不该只有一个“成功”

扫描页经过 OCR、结构化、问答生成、去重、筛选和质量检查,最后得到可使用的内容。最容易忽略的是,前一阶段的错误会被下一阶段写得更像真的:一道题的条件少识别了一个负号,后续问答仍可能流畅得让人不易察觉。

公开教辅工具把这些环节拆开,至少提供了逐段检查的可能。这里讨论的是公开仓库能看到的处理思路,不包含任何任职公司的私有数据、内部部署或未经公开证实的处理规模。

在边界上留下可回查的信息

我希望每个阶段都有清楚的输入、输出和失败理由。OCR 的原图与识别文本最好能对照;问答要能回到来源段落;去重要说明是字面重复还是语义近似;筛选要允许人工推翻。若只在末尾给一个“通过/不通过”,很难知道错误从哪里开始。

这种设计看起来不如一个端到端按钮酷,却更接近日常使用。数据质量不是最后一道附加题,而是从第一个输入开始积累的。模型可以帮助处理,但不能替代对源材料负责。

还没有结论的部分

不同学科的公式、图表与排版差别很大,单一 OCR 或规则不一定适用。未来如果继续完善,我会先建立少量可公开的校验样本,比较每一阶段引入了多少错误、人工复核花了多少时间,再决定是否值得增加更复杂的模型步骤。没有样本之前,不写“准确率显著提升”。