2026 年 8 月 12—14 日
研究进展
按日期记录可复核的研究进展。每次更新分别说明应用、模型、数据集、指标与结论的变化。
训练方法对比
正在核验结果
seed 3407 的三种训练方法对比
CAPID test 上,M1、M2 的联合 F1 均未超过 M0。Reddit 上,M1 相对 M0、M2 相对 M1 的联合 F1 点估计分别提高 0.96 和 0.20 个百分点,但两个 95% 区间都跨 0,未显示明确改善。
正在核验结果
- 应用 · 训练消融详情页现已展示两套完整评测、关键差值区间和机器可读验收信息。
- 模型 · 固定一个基础模型和随机种子 3407,比较同时学习提示词与答案、只学习答案、提高少数相关性标签权重三种方法。
- 数据集 · 只使用 CAPID 作者公开 train 2,107 条、test 200 条和 Reddit 150 条;不生成、翻译、改写或扩充样本。
- 指标 · test 联合 F1 为 92.03% / 91.40% / 91.43%;Reddit 敏感文字 F1 为 81.38% / 84.05% / 83.64%;六组 JSON 可解析率均为 100%。
- 结论 · M1 改善了 Reddit 的跨度识别;其联合 F1 相对 M0 只提高 0.96 个百分点,95% 区间为 [−2.49, 4.40]。M2 相对 M1 的联合 F1 只提高 0.20 个百分点,95% 区间为 [−2.36, 2.74]。两项区间都跨 0;该结果仍只代表 seed 3407。
查看实验设计与结果
归档与指标
结果已验证
探索性实验归档,逐类指标单独发布
当天的最小披露诊断使用了项目组构造的问题和任务变体,相关结果不再计入正式成果;保留下来的只有公共数据集上可独立复核的逐类指标。
- 应用 · 上线归档说明页,列出四个模型的原生输出类别与两张逐类指标表,均附机器可读 JSON。
- 模型 · 原生输出类别数:OpenAI PF 8 类、Nemotron-v2 55 类、Multilingual-v2 54 类、CAPID 15 类。
- 数据集 · 逐类指标全部来自公共数据集;构造数据得到的诊断数字不用于论文、排行榜、模型训练或正式结论。
- 指标 · 静态模型按金标类别报告精确召回率、边界未命中率、字符覆盖率与残留率;CAPID 按 15 个原生类别报告软匹配 P/R/F1。
- 结论 · 每一项分数都绑定具体的模型、数据集和匹配规则;两张逐类指标表不是同一张排行榜。
阅读归档说明与逐类指标
结果展示
已上线
性能页改按主指标排序,最优模型一眼可见
实测结果面板重新排版,四张指标卡的最优模型直接标出;所有数值与结论不变。
- 应用 · 每张卡按主指标排序(F1 降序,泄漏率、p50、显存升序),最佳模型排在首位并加标记;同一模型在四张图中配色一致;新增「各指标最佳模型一览」;详情页结果表加粗最优值。
- 模型 · 不变。
- 数据集 · 不变。
- 指标 · 数值不变;准确率卡新增 F1 的 95% 置信区间脚注,次级指标改用弱化样式。
- 结论 · 结论不变,本次只调整呈现顺序与视觉层次。
查看性能总览
实验评估
结果已验证
完成中文与重点领域数据评测
简体中文、繁体中文、法律、医疗、教育五组公共数据已按完整切分完成评测。
- 应用 · 发布方法、结果与证据;在线演示的推理流程不变。
- 模型 · 对比 OpenAI Privacy Filter 与两个 OpenMed 静态模型配置。
- 数据集 · PII Bench ZH、繁体中文公开切分、TAB、MEDDOCAN 与 PIILO 均使用各自的公开原始切分。
- 指标 · 新增 18 次静态模型全量运行、25,566 条模型—文档预测;报告精确 span F1、字符残留、误遮盖、整篇精确保护与 95% 置信区间。
- 结论 · 中文与跨领域数据上仍存在漏检和误遮盖;单一 F1 无法完整反映脱敏风险。
阅读实验结果
平台发布
系统已上线
PII Context Lab 上线统一多模型评测
从单模型演示扩展为可横向比较的评测平台:静态检测模型与 CAPID 接入统一接口,性能总览与在线演示拆分为两个页面。
- 应用 · 性能总览与在线演示拆分为两个页面;统一接口按模型类型切换输入项与结果结构;界面默认中文,可切换英文。
- 模型 · 接入 OpenAI Privacy Filter、两个 OpenMed 模型权重与 CAPID seed3407 LoRA。
- 数据集 · 建立 9 项数据清单,完成 PIILO、Presidio、Gretel、BigCode 的来源、许可、切分与适配审计;BigCode 未获访问授权,不公布成绩。
- 指标 · 统一统计精确 span F1、精确率、召回率、泄漏率、p50/p95 延迟、显存与模型大小;当天已有 3 个完整切分、9 次模型评测达到发布标准。
- 结论 · 公开榜单不能替代本地固定评测协议;未完成或未获授权的数据只标状态,不公布成绩。
阅读发布说明