可判定的输出,指的是不看答案也能判断对错、能指出错在哪一步的交付物。把培训知识转成实操题时,先定判定标准,再定题目形式;只在小样本上验证过的标准,规模一放大就会出现例外,所以标准里必须写明适用条件。
多数人出题的顺序是反的:先想一道题,再想怎么打分。结果是题目看起来像真实工作,判定却只能靠“感觉对不对”。可判定的实操题通常具备三个特征:输出物固定、判断依据可外部核对、错误类型可归因。
一个可用的短例子(假设场景):给二十个搜索词,要求分成不超过五组,每组写一句意图说明,并标出哪一组最可能同时容纳两种意图。判定时只看三个点——分组数量是否合规、意图说明是否与该组词一致、是否指出了混合意图组。这样即使换一批词,判定规则仍然成立。
小样本上有效的判定标准,放大后经常失灵。最典型的原因是标准依赖了样本本身的特征,而不是依赖方法。以下三种情况会让原本好用的标准失效。
如果练习用的词都是意图清晰的词,判定规则可以写得很粗。一旦换成有歧义的词,同一组里就会出现两种意图,粗规则无法判断对错。此时要补的不是更多规则,而是在题目里明确:遇到歧义词时,是单独成组、还是按主要意图归入现有组。前提条件变了,判定标准也得跟着变。
在熟悉的行业里,判断一个词该归哪组几乎是直觉。换到陌生行业,同样的标准就失效了。解决办法是把直觉写成可检查的步骤,比如先判断词是否包含明确的服务或产品指向,再看是否包含地域或时间限定。步骤可检查,判定才能脱离行业熟悉度。
一次练习全部做对,不能证明方法掌握了;一次练习全错,也不能证明方法有问题。可能是题目难度、样本特征或评分口径造成的。这里要区分相关和因果:分数变化与某个动作同时出现,不代表这个动作导致了变化。判定标准要能说明“错在哪一步”,而不是只给一个总分。
有人为了让判定更严格,把评分项拆到十几条,每条都要求“合理”“恰当”“有逻辑”。这类词无法外部核对,最后仍然要靠出题人主观打分。更麻烦的是,拆得太细之后,不同评分人对同一条的理解不一致,同一份输出可能得到不同结果。可判定不等于条目多,而在于每一条都能被第三方按同一规则复核。判定条目控制在能逐条说清“满足”或“不满足”的范围内,比堆数量更有用。
具体动作是:把已经定好的判定标准,拿到一批没有参与出题的新样本上跑一遍。跑的时候只做两件事——记录每条标准是否仍能给出明确判定,以及记录哪些输出落在“无法判定”的区间。结果会直接影响下一步:如果“无法判定”的比例高,说明标准依赖了旧样本的特征,需要补充适用条件或改写判定语句;如果判定都能给出,但同一份输出在不同人手里结果不同,说明标准还不够外部化,需要把判断依据换成可核对的规则。校准完成后再扩大练习量,否则放大的只是不可判定的题,不是能力。