跳到主要内容
PII CONTEXT LAB多模型隐私评测

平台发布 ·

从单模型演示到统一 PII 评测平台

平台不再只展示 CAPID:同一前端可调用三款静态检测模型与一款查询感知模型;性能页与在线演示分离,实测数字与交互体验不再混淆。


核心变化不是模型数量,而是把两类任务纳入同一接口,并在评测中继续分开解读。

统一模型
4
评测条目
9
完整文本 / 静态模型
108,000
全量结果
9

为什么要改

静态入库脱敏回答“文本里有哪些个人信息”;CAPID 回答“哪些个人信息与当前问题有关”。两类任务的输入、输出与失败模式不同,不能放进同一个 F1 排名。

旧界面以 CAPID 为中心,交互示例容易被误认为正式评测。新版将性能总览、在线试用与原始模型输出分离,每个数字都能溯源到具体协议。

平台包含什么

/
性能总览:仅展示固定数据、固定模型版本、固定解码与固定评测器下产生的结果。
/demo
在线演示:提供模型选择、按模型类型适配的示例、脱敏前后对比与原始输出。
统一 API
统一静态检测与查询感知后端的输入与响应格式,并保留任务类型字段,避免两类输出被混为一谈。

四个模型,三种评测角色

配置角色评测边界
OpenAI privacy-filter + official OPF静态基线参加静态 span 与字符级评测
OpenMed Nemotron-v2静态模型公开模型权重 + 本项目 BIOES 解码器
OpenMed Multilingual-v2静态模型公开模型权重 + 本项目 BIOES 解码器
CAPID seed3407 LoRA查询感知模型单独评估,不参加静态 span 榜

OpenMed 的两项结果并非官方推理封装的成绩,而是公开模型权重搭配本项目零偏置 BIOES 解码器的结果。

完整切分与访问状态同时记录

数据记录数当前状态
PII-Bench(Shen et al.)2,842论文基准未公开;不运行、不公布成绩
NVIDIA Nemotron-PII100,000官方 test 集全量运行
PII Bench ZH formal5,000全量
PII Bench ZH chat3,000全量
TAB(ECHR)1,268数据与评测器公开;本地固定协议待运行
PIILO6,807公开 train corpus,已审计
Presidio Research1,500来源、许可、切分与适配已审计
Gretel test5,594来源、许可、切分与适配已审计
BigCode PII test12,099受控访问;未下载、未评分

成绩什么时候可以展示

只有固定模型版本、解码方法与评测器,并跑完完整测试切分,成绩才会进入性能页;待运行、访问受限或无法复核的数据只展示状态,不公布成绩。

准确率基于完整测试集,95% 置信区间来自 2,000 次文档级 Bootstrap 重采样;p50/p95 延迟在固定样本与相同硬件下测得。在线演示仅用于验证接口与交互,不计入正式对比。

平台之后,开始验证能力边界

下一步将中文兼容性、法律/医疗/教育泛化,以及“提升来自更强 NER 还是隐私能力”拆分为可复核的实验。相关结果已于 8 月 13 日发布。