跳到主要内容
PII CONTEXT LAB多模型隐私评测

实验评估 ·

中文与重点领域 PII 评测

三个静态模型配置在公共数据原始切分上的全量结果。


三种静态模型配置均存在中文 PII 漏检。简体中文上最高的整篇精确保护率仅为 35.12%;TAB 与 MEDDOCAN 上三个配置均为 0%。

新增静态全量运行
18
模型—文档预测
25,566
简中 formal 最佳整篇保护率
35.12%
TAB / MEDDOCAN 最佳整篇保护率
0%

实验怎么做

数据
公共数据原始切分包括:PII Bench ZH 的 5,000 条 formal 与 3,000 条 chat,以及繁体中文 short / mid / long 三组共 910 条。中文语料由数据集发布者合成,不是本项目自建。
模型
对比 OpenAI Privacy Filter 与两个 OpenMed 配置。前者使用官方 OPF;后者使用公开模型权重,搭配本项目实现的 BIOES 解码器。
评测
每个模型都跑完整数据集。预测的字符边界与金标完全一致才算命中;主指标不比较类别名称。
指标
统计精确 span F1、PII 字符残留率、误遮盖率与整篇精确保护率。延迟与显存另用固定 500 条样本测量。
统计
准确率基于全量数据。单模型置信区间来自 2,000 次文档级 Bootstrap 重采样;模型间差值使用同一批文档上的配对重采样。

中文全量结果

简体中文 formal 与 chat 均使用完整数据文件。精确 span F1 衡量实体边界是否完全对准;整篇精确保护要求阳性文档中的全部金标实体都被精确命中——后者更贴近入库脱敏的实际要求。

模型配置formalchat
F1整篇精确保护F1整篇精确保护
OpenAI PF + official OPF0.690435.12%0.493519.77%
OpenMed Nemotron-v20.697427.04%0.560115.83%
OpenMed Multilingual-v20.46795.24%0.484710.33%

formal 上最高 F1 为 0.6974,但最高的整篇精确保护率来自另一配置,且仅为 35.12%。单看 F1,会掩盖单篇文档内仍存在 PII 漏检的事实。

繁体中文 long 组上,三个模型的整篇精确保护率均为 0%。换言之,“支持中文”只意味着模型能处理中文输入,不意味着能完成中文脱敏。

法律、医疗与教育

以 TAB(ECHR)代表法律文本、MEDDOCAN 代表医疗文本、PIILO 公开 train corpus 代表教育写作场景。下表结果均来自完整切分。

模型配置TAB F1MEDDOCAN F1PIILO F1
OpenAI PF + official OPF0.42220.55150.5009
OpenMed Nemotron-v20.35630.25890.0207
OpenMed Multilingual-v20.34610.25470.0171
  • TAB 上,OpenAI 配置的金标字符残留率为 72.84%。
  • TAB 上,两个 OpenMed 配置对 NO_MASK 标注字符的误遮盖率分别为 25.18% 与 28.98%。
  • TAB 与 MEDDOCAN 上,三个模型的整篇精确保护率均为 0%。
  • PIILO 上,Multilingual-v2 在阴性作文上的文档误报率为 68.76%。

不同模型的风险方向相反:一类大量漏掉金标字符,一类在不该遮盖的文本上误遮盖。单一 F1 无法同时刻画这两类风险。

指标定义

F1
预测 span 与金标 span 是否完全一致。
字符残留
金标 PII 字符中仍未被覆盖的比例。
误遮盖
非金标字符被模型遮盖的比例。
整篇精确保护
阳性文档内所有金标实体都被精确命中。
95% 置信区间
使用 2,000 次文档级 Bootstrap 重采样;模型间差值在同一批文档上配对重采样。

结果边界

  • OpenMed 的结果由公开模型权重搭配本项目零偏置 BIOES 解码器得到,不是官方推理封装下的复现成绩。
  • PIILO 使用公开训练语料;本文不将该组结果标注为官方测试集成绩。
  • 领域数据同时改变了语言、标签体系与文档结构,因此结果反映总体迁移表现,而非单一因素的受控因果效应。

下一步

后续先在相同公共测试切分上统一模型封装、解码与阈值,再分别报告漏检、误遮盖和整篇保护率。静态基线稳定后,其他隐私决策能力须在已有公共基准上单独评测。