三种方法均完成 CAPID test 200 条和 Reddit 150 条全量评测。所有 JSON 均可解析;分数由验收报告自动生成,不使用估算值或历史分数。
- 基础模型
- 1
- 训练配置
- 3
- 随机种子
- 3407
- 结果状态
- 正在载入结果
只使用作者公开数据
训练读取 CAPID 作者公开 train 的 2,107 条记录;评测读取公开 test 的 200 条记录和 Reddit 的 150 条记录。本项目不生成、不翻译、不改写,也不扩充样本。
| 用途 | 公开切分 | 记录数 | SHA-256 |
|---|---|---|---|
| 训练 | CAPID train | 2,107 | 0c722cdca74379bcb6e3ae79b583b64ecf7467e018b8a26fb64eb3499ed9ffd8 |
| 同分布评测 | CAPID test | 200 | 2ff1e3e0402299a93e71f5dc581ee5662f6c25b91ae7cdbea99e4144e10d52f9 |
| 域外复核 | CAPID Reddit | 150 | 368b3a8c9ca78e72b9b3562ee5304a40c897610eba78e208fe4eadbfcffd2b59 |
只改变模型从哪些内容中学习
三种方法使用同一个 Llama 3.1 8B 基础模型、同一份公开训练集和相同训练预算。每种方法只保存本次微调产生的参数增量。
- M0
- 让模型同时学习提示词和 JSON 答案
- M1
- 只让模型学习 JSON 答案
- M2
- 只学习 JSON 答案,并提高少数相关性标签的训练权重
这里先固定一个随机种子。这样可以尽快比较训练目标,但不能估计训练随机性。最终结论仍需三个随机种子的完整结果。
CAPID test · 200
主指标要求敏感文字、类别和问题相关性同时正确。辅助指标分别显示文字漏检、类别错误、相关性错误和 JSON 输出失败。
正在载入结果
| 训练配置 | 联合 F1 | span F1 | span + type F1 | 高相关召回 | 低相关召回 | JSON 可解析率 |
|---|---|---|---|---|---|---|
| M0 | 正在载入结果 | |||||
| M1 | 正在载入结果 | |||||
| M2 | 正在载入结果 | |||||
CAPID Reddit · 150
Reddit 结果用于观察同一训练配置离开 test 后是否保持一致。该结果单独报告,不与 test 混合。
正在载入结果
| 训练配置 | 联合 F1 | span F1 | span + type F1 | 高相关召回 | 低相关召回 | JSON 可解析率 |
|---|---|---|---|---|---|---|
| M0 | 正在载入结果 | |||||
| M1 | 正在载入结果 | |||||
| M2 | 正在载入结果 | |||||
跨度识别改善,联合 F1 变化尚不明确
- CAPID test 的联合 F1 为 92.03% / 91.40% / 91.43%(M0 / M1 / M2);M1、M2 均未超过 M0。M1 相对 M0 为 −0.62 个百分点,95% 区间为 [−1.97, 0.76]。
- Reddit 上,M1 相对 M0 的敏感文字 F1 提高 2.68 个百分点,95% 区间为 [0.54, 4.73];联合 F1 只提高 0.96 个百分点,95% 区间为 [−2.49, 4.40],未显示明确改善。
- Reddit 上,M2 相对 M1 将高相关召回提高 5.87 个百分点,却将低相关召回降低 5.41 个百分点;联合 F1 点估计提高 0.20 个百分点,95% 区间为 [−2.36, 2.74],未显示明确改善。
M1 在 Reddit 输出了 2 个不属于 CAPID 15 类的类型;评测保留原始输出并按类型错误计分。
单种子预览不是最终结论
- seed 3407 只能给出一次训练结果,不能反映不同随机种子带来的波动。
- CAPID 作者数据可以比较 CAPID 任务中的训练目标,但不能证明中文、医疗、法律或教育场景的效果。
- 本页不报告显著性检验。最终三种子分析才会估计训练随机性,并进行预注册的配对比较。