可判定的输出不是“看完写一段心得”,而是让不同角色拿着同一份提交物能得出同一结论。做法是先把知识拆成可观察的判断点,再为每个判断点规定证据形态、判定人和通过线。只要判定人换一个就结论翻转,说明输出设计失败,而不是学习者理解不到位。
文章里的知识通常以结论形式出现,比如“标题应包含用户会搜索的词”。这句话无法直接判定,因为它没有说明在什么材料上、由谁、按什么标准核对。转成实操题时,要把它落成一个具体判断:给定一段候选标题和一组查询词,标出哪些词属于用户可能输入的表述,并说明依据。
判定单位越小,分歧越少。把“理解关键词研究”当成一个输出,三个人会交出三份无法比较的东西;把输出限定为“对同一组词完成意图归类,并给出每类的一个代表词”,分歧就集中在归类依据上,而不是散落在表达风格上。
设置时可以用一个简单约束:输出必须能被另一个人在不追问原作者的情况下复核。做不到这一点,说明题目还停留在理解层,没有进入可判定层。
多个角色对同一事实理解不同,常见原因有三类,处理方式完全不同:
把分歧转成可核对项目,关键动作是让分歧显性化。与其要求大家达成一致,不如先让每个人写出自己的判定依据,再对比依据之间的差异。差异本身就是要核对的对象。
好的实操题输出应包含三类证据,缺一类就会留下争论空间:
假设一个练习要求判断某段正文是否偏离主题。若只交“偏离”,无法核对;若交“偏离,因为第二段整段在讲与查询意图无关的背景,且没有给出该主题下的具体做法”,另一个人就能回到原文核对。这里的关键不是结论对错,而是结论是否可被检验。
需要提醒的是,证据充分不等于结论正确。一段文字被标为偏离,可能是因为判定标准本身过窄,而不是写作者跑题。这就是下面要说的失效条件。
可判定输出有一个容易忽略的失效条件:当题目本身选取的材料无法体现该知识时,所有人按同一标准判定,会得到一致但无意义的结论。
例如,用一段完全没有标题结构的纯叙述文字,去练习“标题层级是否合理”。判定标准再清楚,也只能得出“没有标题”这一结论,无法区分学习者是否真的掌握层级判断。此时一致性来自题目缺陷,不来自能力。
判断方法很简单:把题目交给一个完全没学过该知识的人,如果他能靠常识或格式规则直接得出答案,这道题就不具备区分力。可判定输出要求的是可核对,不是可猜测。
实际操作时,不要一次设计整套题库。先选一个知识点,写出题目、标准答案和判定依据,然后找另一个人独立完成并核对。
如果两人结论一致且依据可互相验证,说明这个判定单位成立,可以按同样结构扩展其他知识点。如果两人结论不同,先别改答案,先检查是观察对象、判定标准还是证据层级没写清。多数情况下,改这三处比增加练习题更有效。
核对通过后,再把输出格式固定下来,让后续练习沿用同一结构。结构固定之后,不同批次的学习结果才有比较基础,否则每次都在比较表达方式,而不是比较判断质量。