核心变化不是模型数量,而是把两类任务纳入同一接口,并在评测中继续分开解读。
- 统一模型
- 4
- 评测条目
- 9
- 完整文本 / 静态模型
- 108,000
- 全量结果
- 9
为什么要改
静态入库脱敏回答“文本里有哪些个人信息”;CAPID 回答“哪些个人信息与当前问题有关”。两类任务的输入、输出与失败模式不同,不能放进同一个 F1 排名。
旧界面以 CAPID 为中心,交互示例容易被误认为正式评测。新版将性能总览、在线试用与原始模型输出分离,每个数字都能溯源到具体协议。
平台包含什么
//demo四个模型,三种评测角色
| 配置 | 角色 | 评测边界 |
|---|---|---|
| OpenAI privacy-filter + official OPF | 静态基线 | 参加静态 span 与字符级评测 |
| OpenMed Nemotron-v2 | 静态模型 | 公开模型权重 + 本项目 BIOES 解码器 |
| OpenMed Multilingual-v2 | 静态模型 | 公开模型权重 + 本项目 BIOES 解码器 |
| CAPID seed3407 LoRA | 查询感知模型 | 单独评估,不参加静态 span 榜 |
OpenMed 的两项结果并非官方推理封装的成绩,而是公开模型权重搭配本项目零偏置 BIOES 解码器的结果。
完整切分与访问状态同时记录
| 数据 | 记录数 | 当前状态 |
|---|---|---|
| PII-Bench(Shen et al.) | 2,842 | 论文基准未公开;不运行、不公布成绩 |
| NVIDIA Nemotron-PII | 100,000 | 官方 test 集全量运行 |
| PII Bench ZH formal | 5,000 | 全量 |
| PII Bench ZH chat | 3,000 | 全量 |
| TAB(ECHR) | 1,268 | 数据与评测器公开;本地固定协议待运行 |
| PIILO | 6,807 | 公开 train corpus,已审计 |
| Presidio Research | 1,500 | 来源、许可、切分与适配已审计 |
| Gretel test | 5,594 | 来源、许可、切分与适配已审计 |
| BigCode PII test | 12,099 | 受控访问;未下载、未评分 |
成绩什么时候可以展示
只有固定模型版本、解码方法与评测器,并跑完完整测试切分,成绩才会进入性能页;待运行、访问受限或无法复核的数据只展示状态,不公布成绩。
准确率基于完整测试集,95% 置信区间来自 2,000 次文档级 Bootstrap 重采样;p50/p95 延迟在固定样本与相同硬件下测得。在线演示仅用于验证接口与交互,不计入正式对比。
平台之后,开始验证能力边界
下一步将中文兼容性、法律/医疗/教育泛化,以及“提升来自更强 NER 还是隐私能力”拆分为可复核的实验。相关结果已于 8 月 13 日发布。