Privacy Filter
Empêcher qu'un assistant IA envoie le contenu de ses propres mails dans le cloud. Un classifieur PII en local s'intercale entre Claude Code et l'API, masque les noms, emails, téléphones avant l'envoi.
Video a venir
De quoi il s'agit
OpenAI a publié `openai/privacy-filter`, un classifieur de tokens à 1.5 milliards de paramètres sous Apache 2.0 qui détecte les données personnelles dans un texte. Le modèle tourne en local. Le lab le branche entre Claude Code et l'API Anthropic, via mitmproxy.
La zone protégée
Quand un agent fouille des mails, des fiches CRM ou la mémoire long terme, le volume de données personnelles qui remonte est imprévisible : signatures, copies cachées, pièces jointes, threads voisins. Le filtre porte sur ce contenu découvert en cours de route. La requête initiale de l'utilisateur part telle quelle. Avant d'arriver chez Anthropic, chaque entité (personne, email, téléphone, adresse, IBAN, SIRET) est remplacée par un placeholder stable. Marc Dupont reste PERSON_001 sur toute la session : Claude raisonne sur l'identité opaque sans perdre le fil.
L'architecture
Un service FastAPI charge le modèle une fois et expose `POST /filter`. Un mitmproxy intercepte les requêtes vers `api.anthropic.com/v1/messages` avec deux addons en cascade : le premier réécrit, le second capture pour l'UI temps réel du sniffer Claude Analysis. Un wrapper `k --anon --sniff --tools` lance les trois services en une commande.
Résultats mesurés et angles morts
Sur une session réelle de recherche de mails : 9 appels filtrés, 235 entités masquées, 0 nom ni adresse partis chez Anthropic. Le français business est très bien couvert malgré la note principalement anglais du model card. En revanche, un prénom tapé en minuscules au fil de l'eau (`je suis fabien`) échappe au modèle. Et les clés API au format `sk-ant-api03-XXXXXXX` ne sont pas reconnues comme secrets.
Les limites
La brique sémantique couvre la base : noms, contacts, comptes, adresses. Elle ne suffit pas seule comme couche de conformité. Il faut y empiler une regex sur les patterns syntaxiques fixes, un dictionnaire métier sur les noms d'entreprises, et un humain dans la boucle sur les contenus sensibles.