Privacy Filter
Empêcher qu'un assistant IA envoie le contenu de ses propres mails dans le cloud. Un classifieur PII en local s'intercale entre Claude Code et l'API, masque les noms, emails, téléphones avant l'envoi.
Video a venir
De quoi il s'agit
OpenAI a publié `openai/privacy-filter`, un classifieur de tokens à 1.5 milliards de paramètres sous Apache 2.0 qui détecte les données personnelles dans un texte. Le modèle tourne en local. Le lab le branche entre Claude Code et l'API Anthropic, via mitmproxy.
Ce que le filet protège
Quand un agent fouille des mails, des fiches CRM ou la mémoire long terme, le volume de données personnelles qui remonte est imprévisible : signatures, copies cachées, pièces jointes, threads voisins. C'est ce contenu découvert dynamiquement qui est filtré, pas la requête initiale de l'utilisateur. Avant d'arriver chez Anthropic, chaque entité (personne, email, téléphone, adresse, IBAN, SIRET) est remplacée par un placeholder stable. Marc Dupont reste PERSON_001 sur toute la session : Claude raisonne sur l'identité opaque sans perdre le fil.
L'architecture
Un service FastAPI charge le modèle une fois et expose `POST /filter`. Un mitmproxy intercepte les requêtes vers `api.anthropic.com/v1/messages` avec deux addons en cascade : le premier réécrit, le second capture pour l'UI temps réel du sniffer Claude Analysis. Un wrapper `k --anon --sniff --tools` lance les trois services en une commande.
Ce qui marche, ce qui rate
Sur une session réelle de recherche de mails : 9 appels filtrés, 235 entités masquées, 0 nom ni adresse partis chez Anthropic. Le français business est très bien couvert malgré la note principalement anglais du model card. En revanche, un prénom tapé en minuscules au fil de l'eau (`je suis fabien`) échappe au modèle. Et les clés API au format `sk-ant-api03-XXXXXXX` ne sont pas reconnues comme secrets.
Le positionnement honnête
Une brique sémantique solide qui couvre la base : noms, contacts, comptes, adresses. Pas une couche de compliance suffisante seule : à empiler avec une regex sur les patterns syntaxiques fixes, un dictionnaire métier sur les noms d'entreprises, et un humain dans la boucle sur les contenus sensibles.