Inverse Scaling Prize 4种评估指标选择指南:classification、sequence_prob与logodds到底该用哪个

Inverse Scaling Prize 4种评估指标选择指南:classification、sequence_prob与logodds到底该用哪个 Inverse Scaling Prize 4种评估指标选择指南classification、sequence_prob与logodds到底该用哪个【免费下载链接】prizeA prize for finding tasks that cause large language models to show inverse scaling项目地址: https://gitcode.com/gh_mirrors/pr/prizeInverse Scaling Prize逆缩放奖是一个寻找大语言模型越大、表现反而越差任务的高额奖金竞赛。提交任务时你必须从 4 种官方评估指标中选一个来证明逆缩放现象classification、sequence_prob、logodds与absolute_logodds。选错指标不仅趋势会失真还可能因假逆缩放被直接淘汰。本文用一张对照表和一份决策清单帮你快速选对指标、避开常见坑。逆缩放是什么Inverse Scaling Prize 的核心目标按标准缩放定律语言模型的参数、算力、数据越多任务表现越好。而逆缩放inverse scaling指的是相反的趋势模型越强在某个任务上做得越差。竞赛就是要找到这类任务尤其是关乎大语言模型安全使用的任务。官方规则与指标定义详见 README.md 的Evaluation metrics章节。4种评估指标一张表看懂指标回答的问题CSV 必需列适用场景官方风险提醒classification能否从候选答案中选对prompt/classes/answer_index标准多选题⭐ 首选趋势最清晰sequence_prob能否预测出目标补全prompt/completion唯一标准答案的补全概率难以解释能改多选就改logodds两个 prompt 的概率差带符号prompt/other_prompt/classes/answer_index测偏差、提示敏感性⚠️ 易出现假逆缩放需对照实验absolute_logodds两个 prompt 的概率差取绝对值同logodds差异方向不确定的场景⚠️ 同上classification 多分类评估指标为什么它是首选适合从一列候选答案中选出正确项的标准分类任务官方会同时考察分类损失loss和分类准确率accuracy两者预期只有一个出现逆缩放时要说明理由。几条关键写法建议类 token 几乎总要以空格 大写字母开头例如 Yes、 No而不是yes、notoken 化机制决定的。每个候选答案尽量保持相同 token 长度最好设计成单个 token如 A、 B、 C、 D避免长序列概率天然偏小的干扰。把多候选补全改写成显式多选题能引导模型把概率集中到合法答案上趋势更干净。自第二轮起允许每条样本有不同数量的候选类别。使用classification的任务更容易通过组委会的人工标注核验流程。上图NeQA分类任务在不同模型系列上的零样本准确率随计算量的变化多条曲线出现逆缩放趋势。sequence_prob 补全序列指标什么时候才需要它当任务目标是预测 prompt 末尾的那段正确结论/补全时使用LAMBADA 式目标是单一带、可由多 token 组成。列只有两个prompt目标词之前的文本completion目标序列。⚠️ 官方明确建议能用classification就优先用它。序列概率常常难以解释——一个 prompt 可能有多个正确补全互相竞争概率质量。获奖任务prompt-injection就是少数使用sequence_prob发布文件为prompt-injection_sequence-probability.jsonl的例子其评估结果如下上图sequence_prob指标下的负对数似然损失随模型规模的变化越小越好。logodds 与 absolute_logodds测相对偏好的高风险指标这两个指标测量模型在两个 prompt 之间如何改变两个候选答案的相对概率——模型可以整体变好但两者差距在拉大这在指标上就是逆缩放。logodds带符号prompt应中性或偏向正确/理想答案other_prompt应中性或偏向错误/不良答案。适合验证偏差方向已知的任务例如对某一性别的系统性偏差。评估时取两个 prompt 的有符号平均差。absolute_logodds绝对值先对每条样本的差取绝对值再平均。适合预期有差异但方向不确定的场景例如对 prompt 做应无关紧要的改写后观察扰动。answer_index在此指标中仅为格式兼容可任选。⚠️官方警告logodds与absolute_logodds是假逆缩放的已知来源——只要把两个不相关任务分别放进prompt和other_prompt甚至只给其中一个加无关信息就可能测出逆缩放。因此能改写成classification或sequence_prob的任务请改写必须使用时做对照实验用中性表述替换你怀疑导致逆缩放的成分并把对照数据以task_name-CONTROL1.csv命名随提交一并上传附说明与图。30秒决策清单你的任务该用哪个指标能从有限候选答案里选出一个正确答案→classification默认首选✅prompt 之后只有一段标准补全固定结论、唯一答案→sequence_prob要比较两个 prompt 间候选概率的相对变化差异方向明确如偏差方向已知→logodds只知道有差异、方向不定 →absolute_logodds以上两种都必须准备对照实验 以上都不适用→ 按 README 说明联系组委会确认不要自造指标11个获奖数据集透露的信号官方已把全部获奖任务数据发布在 />上图Modus Tollens分类任务在 Anthropic LM 系列上0-shot 到 72-shot 不同示例数量下的准确率曲线——小模型 0-shot 尚可随规模增大准确率急剧下滑。一句话总结默认选classificationprompt 只有唯一标准补全时选sequence_problogodds/absolute_logodds留给偏差与提示敏感性这类比较两个 prompt的任务并务必附上对照实验。指标选对逆缩放趋势才能被干净地看见。【免费下载链接】prizeA prize for finding tasks that cause large language models to show inverse scaling项目地址: https://gitcode.com/gh_mirrors/pr/prize创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考