核心做法是:不要先想“我要出几道题”,而是先确定一个能被第三方复核的判定物。对单篇文章,你可以用“概念—条件—反例”三行结构;一旦要批量生成,就必须把判定物改成可枚举的字段,否则个别样本成立、规模上去后必然出现大量无法判分的题。下面从“小样本能判、放大后失效”这个矛盾切入,给出两种解释和区分证据。
假设你从一篇讲“如何设计调查问卷”的文章里抽知识,手工改成实操题,效果通常不错。你能凭理解判断学员答得对不对。但把同一套改法交给批量流程,产出几十道题后,会发现大量题目的“正确答案”依赖出题人的隐含理解,换个人就判不了。
这不是你变笨了,而是判定依据从“我懂”变成了“文字里有没有”。单篇时你能补背景,批量时没人补,判定物必须自证。
解释一:这类文章的知识偏“情境判断”,本来就没有唯一答案,所以不适合做客观实操题。
解释二:知识可以判定,但你在抽取时把前置条件和排除条件丢了,只剩结论,导致题目边界模糊。
两者的区别在于:前者无论怎么改都判不了,后者只要把条件补回来就能判。判断属于哪一种,可以做一个动作:把同一道题交给两个不了解原文的人,让他们各自写出“什么答案算对”。如果两人写出的判定标准几乎一致,说明是抽取方式的问题;如果两人标准明显冲突,且冲突点正是文章没写清的地方,说明该知识点本身不适合直接转成可判定题。
一个可判定的实操题,输出物要满足三个特征:答案空间可枚举、判定依据在题面内、错误答案有明确归因。可以按下面的字段来设置:
一个假设例子:文章说“问卷预测试通常找5到10人”。直接出题“预测试找几人”不可判定,因为“通常”被抽掉了。改成“在探索性预测试、目标是发现理解障碍时,样本量应处于哪个区间”,答案空间才收窄。这个改动本身不保证题目有效,但它让判定依据从隐含理解变成了题面条件。
批量失效的常见原因,是每道题的判定标准都写在出题人脑子里。解决办法不是写更长的提示,而是先定一个统一的判定模板,再往里填内容。
这个动作的结果会直接影响下一步:如果第二篇能顺利套用,说明模板可扩量;如果反复卡在同一类知识点上,说明你需要先补一个“适用条件”字段,而不是继续加题量。
这套方法适用于“有明确条件、有可枚举答案”的知识。以下情况不能直接照搬:文章本身是观点评论、案例叙事或价值判断;知识点依赖读者所在机构的内部规范;答案正确性需要实时数据或外部权威确认。遇到这些,要么改成“判断某说法是否与原文一致”的核对题,要么明确标注为开放性任务并另配评分量规,不要伪装成客观题。
另外,判定物可枚举不等于题目一定有效。它只保证判分时标准一致,不保证题目能测出你真正想测的能力。所以每次扩量后,仍要抽几道题让不了解原文的人试判,用他们的判定分歧来定位模板漏洞。