如何准备数据匿名化并检查重新识别风险。
删除明显的标识符并不能保证匿名。请检查仍可能识别个人的字段组合和罕见值。
按任务需求调整流程。
识别直接标识符、罕见组合以及可能暴露身份的自由文本。明确数据发布目的,再相应删除、泛化或替换字段。将任何重新识别密钥单独保存,并说明剩余风险,不要自动将输出标为匿名数据。
- 你需要提供什么
- 提供的小型数据集和选定的脱敏策略。
- 你会得到什么
- 已脱敏或合成替换的值,并附剩余风险说明。
查看输入和结果。
演示用输入和输出 · 教学示例,并非 WebAct 实时运行结果
示例 个输入项
Fictional internal table: name Alex Example; email alex@example.com; role "sole night-shift laboratory coordinator". Prepare a public summary requiring only a broad job family.
完整示例
Public-summary draft: job_family: operations Removed: name, email and unique role wording. No stable person ID is needed for this purpose. A single-record summary could still be identifying through context; this transformation is not an anonymity certification.
将这份输入载入提示词,再复制到 WebAct 中尝试任务。实际结果可能与示例不同。
决策与问题排查。
将姓名替换为随机 IDs 就能让数据集匿名吗?
这可能仅对记录进行了假名化。其他字段或保留的映射关系仍可能将记录与个人关联。
为什么删除邮箱地址后仍可能认出某个人?
独特职务、日期、地点或叙述细节组合起来可能识别个人。请检查整个记录及预期受众。
使用自己的资料试一试。
将任务提示词中的示例换成你的材料。保留所需条件,再把任务复制到 WebAct。
自定义并复制任务 ↑