三种静态模型配置均存在中文 PII 漏检。简体中文上最高的整篇精确保护率仅为 35.12%;TAB 与 MEDDOCAN 上三个配置均为 0%。
- 新增静态全量运行
- 18
- 模型—文档预测
- 25,566
- 简中 formal 最佳整篇保护率
- 35.12%
- TAB / MEDDOCAN 最佳整篇保护率
- 0%
实验怎么做
中文全量结果
简体中文 formal 与 chat 均使用完整数据文件。精确 span F1 衡量实体边界是否完全对准;整篇精确保护要求阳性文档中的全部金标实体都被精确命中——后者更贴近入库脱敏的实际要求。
| 模型配置 | formal | chat | ||
|---|---|---|---|---|
| F1 | 整篇精确保护 | F1 | 整篇精确保护 | |
| OpenAI PF + official OPF | 0.6904 | 35.12% | 0.4935 | 19.77% |
| OpenMed Nemotron-v2 | 0.6974 | 27.04% | 0.5601 | 15.83% |
| OpenMed Multilingual-v2 | 0.4679 | 5.24% | 0.4847 | 10.33% |
formal 上最高 F1 为 0.6974,但最高的整篇精确保护率来自另一配置,且仅为 35.12%。单看 F1,会掩盖单篇文档内仍存在 PII 漏检的事实。
繁体中文 long 组上,三个模型的整篇精确保护率均为 0%。换言之,“支持中文”只意味着模型能处理中文输入,不意味着能完成中文脱敏。
法律、医疗与教育
以 TAB(ECHR)代表法律文本、MEDDOCAN 代表医疗文本、PIILO 公开 train corpus 代表教育写作场景。下表结果均来自完整切分。
| 模型配置 | TAB F1 | MEDDOCAN F1 | PIILO F1 |
|---|---|---|---|
| OpenAI PF + official OPF | 0.4222 | 0.5515 | 0.5009 |
| OpenMed Nemotron-v2 | 0.3563 | 0.2589 | 0.0207 |
| OpenMed Multilingual-v2 | 0.3461 | 0.2547 | 0.0171 |
- TAB 上,OpenAI 配置的金标字符残留率为 72.84%。
- TAB 上,两个 OpenMed 配置对 NO_MASK 标注字符的误遮盖率分别为 25.18% 与 28.98%。
- TAB 与 MEDDOCAN 上,三个模型的整篇精确保护率均为 0%。
- PIILO 上,Multilingual-v2 在阴性作文上的文档误报率为 68.76%。
不同模型的风险方向相反:一类大量漏掉金标字符,一类在不该遮盖的文本上误遮盖。单一 F1 无法同时刻画这两类风险。
指标定义
结果边界
- OpenMed 的结果由公开模型权重搭配本项目零偏置 BIOES 解码器得到,不是官方推理封装下的复现成绩。
- PIILO 使用公开训练语料;本文不将该组结果标注为官方测试集成绩。
- 领域数据同时改变了语言、标签体系与文档结构,因此结果反映总体迁移表现,而非单一因素的受控因果效应。
下一步
后续先在相同公共测试切分上统一模型封装、解码与阈值,再分别报告漏检、误遮盖和整篇保护率。静态基线稳定后,其他隐私决策能力须在已有公共基准上单独评测。