别漏掉PII! 带有变形器.js和WASM的本地数据遮盖

2026年8月2日2 次浏览来源:Dev.to阅读原文

在数据隐私不再是"好到有"而是法律授权(看您,GDPR和HIPAA)的时代,向云中发送原始用户数据就像玩火.

如果你正在建立健康技术或fintech应用软件, 暴露个人识别信息(PII)的风险 是一个持续的头痛。

但如果数据从未离开用户的浏览器的原始形式呢?

输入Edge AI和隐私保护AI。

通过利用Transformers.js和WebAssem(WASM),我们可以进行复杂的命名实体识别(NER),直接去识别客户端的敏感信息.

我们的方法在"Edge"(浏览器)截取数据.

通过使用WebAssembly,我们获得在浏览器中运行基于BERT的模型的近乎本地性能,确保UI保持快活,同时保持数据100%本地化.

前提条件 QQ 随行需要: Tech Stack: TypeScript, Vite, and Transformers.js.

基本理解NER(名称实体识别).

喜欢不被起诉 数据泄露。

QQ 第1步:设置"隐私管道"第一,让我们安装库:现在,让我们创建我们的服务.

我们将使用一个为网络所优化的轻量级NER模型。

第二步:与健康数据表融合 想象一个用户打入他们的症状:"我叫爱丽丝·史密斯,自从我到纽约的诊所就一直觉得头晕".

在同步前,我们需要给"爱丽丝·史密斯"和"纽约"做口罩.

为什么?

你可能会想, "为什么不只是使用雷克克斯?" Regex对图案(如电子邮件或SSN)很有用,但是在自然语言中检测名称或位置时却失败了.

通过使用变形器.js与Web Assembly, 我们运行了一个真正的深层学习模型。

WASM允许浏览器高速执行二进制代码,从而可以运行100MB+ 初始负载后以毫秒为单位的BERT型.

对于处理大规模边疆AI部署或建造生产准备去识别管道的更先进的模式,我强烈建议仔细检查深潜情况。

技术/博客。

它们覆盖了超越了浏览器的"Privacy by Design"的宏伟建筑蓝图.

性能考虑 QQ模型大小:BERT-base对移动可能很重.

考虑使用或版本将初始下载量保持在20MB以下.

缓存:变形器.js使用缓存API.

在第一次负载后,该型号在当地被存储,使得后期使用即时.

网络工人: 在现实世界的应用中,在Web Worker中运行该程序,以确保主UI线程在推论期间不会结巴.

结论:隐私是"隐私第一"(Privacy First)建筑的地物, 通过实施Edge AI去识别,你消除PII泄漏的风险 在数据甚至触及你的基础设施之前。

效益摘要:没有PII到达您的日志或数据库。

NLP推论零服务器成本.

QQ 默认与全球隐私条例相符合.

你在边缘用AI了吗?

如果你发现这有帮助,请在下面放出一则评论或分享你与变形金刚.js的经验!

快乐的编码!

更多Edge AI和数据安全的例子, 技术/博客.

分享