结论先说:把自动评分限制在可复现的客观字段上,把需要语境、意图和取舍的项目单独列为人工裁决项,并让评分在缺少人工结论时显示为“未完成”而不是“通过”。这套做法成立的前提是,评分结果会被用于对外交付或跨团队决策;如果评分只用于内部排序、且没人依据它做取舍,强行拆出人工环节只会增加成本。
自动评分擅长处理的是能够从原始数据直接推导的字段,例如页面是否返回正常状态、标题是否存在、结构化数据能否解析、链接是否可达。这些项目的共同点是判断标准唯一,换个人看结论相同。
需要人工判断的项目则相反,判断依赖语境:一段内容是否真正回答了搜索意图、两个页面是否构成重复、某个内链锚文本是否自然、某条外链是否值得保留。这类项目即使被工具打出一个分数,分数也只是某个模型的近似值,不构成结论。
可以把工具输出拆成三列来管理:
这个拆分的实际动作是:在导出结果里新增一列“裁决状态”,默认值为待定,只有人工填写后才能进入交付清单。结果是评分再高也不会自动进入最终报告,下一步的复核范围因此被限定在真正需要看的条目上。
如果团队把评分直接接入发布流程,例如分数低于某个阈值就自动拦截页面,那么“评分只作线索”的前提就不成立了。此时评分实际上承担了裁决职能,人工环节被绕过,前面那套拆分只是形式。
这类流程还有一个隐蔽问题:拦截发生后,处理的人往往只关心怎样把分数提上去,而不是判断页面本身是否合格。分数上升可能来自删掉了必要的正文、堆叠了关键词,或者把一个正常页面改成了模板化结构。分数改善与质量改善之间没有必然联系,两者同时出现也不能证明是前者导致了后者。
判断是否已经落入这种情况,可以看一个信号:当被问到某个页面为什么通过时,回答是“分数够了”,而不是“因为它的内容覆盖了这几类查询意图”。出现这个信号,说明人工判断已经被替代。
防止替代的关键不是拒绝评分,而是让评分无法单独完成一次决策。具体做法是要求每个裁决项至少留下三项内容:判断结论、依据、以及不确定的地方。
假设一个场景:工具把两个页面标记为高度相似并给出高分风险,人工复核后发现一个是产品说明、一个是同类产品的对比内容,两者服务不同查询意图。此时结论应为“不构成重复”,依据是查询意图不同,不确定处是如果对比内容被并入产品页,判断需要重做。这个例子只用于说明记录方式,不代表任何具体工具的判定逻辑。
人工裁决容易被形式化:填了状态,但结论与依据不匹配,或者长期由同一个人按同一套说辞填写。要发现这种情况,可以定期抽取已裁决条目,遮住结论只看依据,让另一个人重新判断,比较两次结论是否一致。
一致率低说明判断标准没有对齐,需要先统一标准再继续扩大处理量;一致率高但依据栏普遍空泛,说明记录方式没有约束力,需要把依据要求改成必须可被第三方复核。这个动作的结果直接决定下一步:是补充标准说明,还是收紧记录模板,而不是继续增加评分维度。
需要注意,抽查发现的不一致本身不能证明评分错误,也不能证明人工更准。它只说明判断标准需要澄清,具体原因还要回到条目本身去看。
评分适合回答“先看什么”,不适合回答“能不能过”。当工具的具体功能、字段含义或阈值设置不清楚时,应当核对工具自身的说明文档,不同工具对同一名称的指标定义可能不同,不能按字面直接比较。
落地时可以先做一件事:找出当前流程里所有由评分单独触发的动作,逐个确认这些动作是否真的可以只靠评分完成。凡是不能的,补上人工结论字段,并规定没有该字段时流程停在待定状态。这一步做完,人工判断就不再是评分之后的补充说明,而是决策链上不可跳过的一环。