English Deutsch 日本語
Innovius · ShinrAI 信頼 · Semantische Verschlüsselung

PII-Benchmark-Board

Wie gut funktionieren PII-Detektoren wirklich? Wir messen unsere eigenen Releases und das gesamte Feld auf denselben Texten, mit derselben Bewertung — und veröffentlichen alles, auch dort, wo wir zurückliegen.

🇩🇪 🇬🇧 🇺🇸 🇫🇷 🇪🇸 🇮🇹 🇵🇱 🇵🇹 🇧🇷 🇷🇺 🇺🇦 🇹🇷 🇸🇦 🇯🇵 🇰🇷 🇮🇱
15 Sprachräume · ein Modell · 🇪🇺 Release mit EU-Fokus, weitere folgen · 🇮🇱 Hebräisch ist Beta
Calm, private AI

Drei Releases auf einem Board

ShinrAI 1.1

SprachenDE · EN · JA
Erkennung4 Heads · 12 Klassen

Die erste offene Generation (2026). Weiterhin als Archiv verfügbar.

ShinrAI 1.2

Sprachen6 westliche Sprachen
Erkennung4 Heads · 12 Klassen

Größere Inventare, 1024-Token-Fenster. Archiv.

ShinrAI 1.3

Sprachen15 Sprachräume
Erkennung19 Heads · 27 Klassen

Das aktuelle Release: Identifier-Formate im Modell, Herkunftsattribut mit 51 Klassen, Japanisch auf bestem Stand.

Ausblick: ShinrAI 1.4 ist im Training — Schwärzung langer Dokumente, das Formular-Register, Hebräisch Richtung Vollunterstützung.

Die Spalten „ShinrAI 1.3“ zeigen das offene Modell hinter unseren Standard-Serving-Einstellungen — die Zahl, die zählt. Das Enterprise-Produkt legt zusätzliche regelbasierte Erkennung darüber (Prüfsummen-Validatoren, deterministische Identifier); diese Schicht ist konstruktionsbedingt exakt und nicht Teil dieser Werte.

Unser Test über 15 Sprachräume

Geschäfts- & Klinikbriefe — unser Test über 15 Sprachräume
Realistische Briefe, Rechnungen und Kliniknotizen je Sprache. Finde jeden Namen, Ort, jede Firma und jeden Identifier.
Sehr geehrte Frau Keller, Ihr Termin in Leipzig ist bestätigt — Kundennummer KD-2024-88371.

F1-Wert (0–100, höher ist besser · exakte Spannen). 200 Texte je Sprachraum. Der Median von 95.0 schließt das hebräische Beta ein. Azure AI PII, gemessen auf denselben Texten: 53–76.

LandSpracheWertF1Präzision / Trefferquote
🇯🇵JA
98.198.3 / 97.8
🇬🇧🇺🇸EN
97.797.2 / 98.1
🇧🇷PT-BR
97.397.7 / 96.9
🇪🇸ES
96.997.2 / 96.6
🇷🇺RU
96.496.2 / 96.7
🇫🇷FR
96.096.3 / 95.8
🇰🇷KO
95.595.9 / 95.2
🇮🇹IT
95.096.3 / 93.8
🇩🇪🇦🇹🇨🇭DE
94.495.3 / 93.5
🇵🇹PT-PT
94.295.3 / 93.1
🇵🇱PL
90.991.4 / 90.3
🇹🇷TR
90.190.7 / 89.5
🇸🇦AR
87.990.3 / 85.6
🇺🇦UA
86.789.2 / 84.3
🇮🇱HE Beta
59.568.8 / 52.3

Das Land zählt: Das Modell weiß, wie ein Straßenname in Frankreich gegenüber Spanien aussieht — und wie ein Firmenname in Japan. Erkennung und Ersetzungen folgen den Konventionen jedes Landes.

Öffentliche Testsets — alle im selben Prüfstand

Jeder Wettbewerber läuft an seinem besten Schwellwert; ShinrAI läuft mit Standardeinstellungen. Werte sind F1 (0–100, höher ist besser) mit großzügigem Abgleich — ein Fund zählt, wenn er den richtigen Text mit dem richtigen Typ trifft (siehe Glossar). ★ markiert das beste System je Zeile. ⚠ markiert Systeme, die auf genau diesem Testset trainiert haben.

Farben in den Beispielen: Person · Ort · Identifier · Organisation
ai4privacy — Alltagsnachrichten
Kurze Chatnachrichten und Formularausschnitte mit eingebetteten persönlichen Daten. Vier Sprachen.
Hi Maria Ortega, your parcel to 8 Elm Road, Leeds arrives Friday.
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3LFM2.5 PII (Liquid AI)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
DE81.583.685.469.435.611.021.390.3 ★
⚠ Trainingsüberschneidung wahrscheinlich
77.8
EN80.575.580.876.738.310.921.186.9 ★
⚠ Trainingsüberschneidung wahrscheinlich
70.268.450.069.1
FR80.782.482.674.537.99.716.290.6 ★
⚠ Trainingsüberschneidung wahrscheinlich
75.9
IT76.577.683.370.945.213.125.389.0 ★
⚠ Trainingsüberschneidung wahrscheinlich
73.8
MultiNERD — Enzyklopädie-Sätze
Sätze im Wikipedia-Stil in acht Sprachen. Finde die Personen und Organisationen.
Clara Immerwahr studied chemistry in Breslau before joining the university institute.
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3LFM2.5 PII (Liquid AI)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
DE72.878.192.1 ★62.345.625.737.958.591.3
⚠ Trainingsdaten nicht offengelegt
EN79.383.294.960.945.817.328.558.796.2 ★
⚠ Trainingsdaten nicht offengelegt
86.965.186.5
ES85.673.597.7 ★61.539.016.529.564.493.3
⚠ Trainingsdaten nicht offengelegt
FR84.172.893.3 ★61.740.216.526.961.490.3
⚠ Trainingsdaten nicht offengelegt
IT88.567.896.8 ★56.233.911.821.760.491.4
⚠ Trainingsdaten nicht offengelegt
PL74.773.581.265.932.320.123.745.787.8 ★
⚠ Trainingsdaten nicht offengelegt
PT81.073.394.762.738.415.428.861.096.1 ★
⚠ Trainingsdaten nicht offengelegt
RU71.170.582.5 ★53.934.917.918.151.582.5 ★
⚠ Trainingsdaten nicht offengelegt
Gretel — synthetische Geschäftsdokumente
Maschinell erzeugte Urkunden, Anträge und Akten — das Formular-Register.
ADOPTION CERTIFICATE — confirms the adoption of Urvashi Jaggi, identifier UID-PRWBO4TB.
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3Azure AI PII (Microsoft)Presidio (open source)LFM2.5 PII (Liquid AI)Privacy Filter (OpenAI)OpenMed PII E5OpenMed Privacy FilterGLiNER PII (Urchade)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)Piiranha v1 (III)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
EN24.125.452.230.744.284.5 ★34.078.174.324.354.624.823.551.460.053.946.437.339.7
Nemotron-PII — synthetische US-Formulare
Maschinell erzeugte US-Antragsformulare und Briefe (NVIDIA-Testset).
I, Jason, live at 87 Avenida De La Estrella. Date of birth 1987-05-22.
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3Azure AI PII (Microsoft)Presidio (open source)LFM2.5 PII (Liquid AI)Privacy Filter (OpenAI)OpenMed PII E5OpenMed Privacy FilterGLiNER PII (Urchade)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)Piiranha v1 (III)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
EN25.142.264.446.557.587.354.693.9 ★
⚠ auf diesem Testset trainiert
89.612.949.711.010.964.865.568.068.341.248.7
TAB — echte Gerichtsurteile (lange Dokumente)
Echte Entscheidungen des Europäischen Gerichtshofs für Menschenrechte, je rund 5.000 Zeichen. Anonymisiere die Personen und Organisationen.
…lodged by Mr Henrik Hasslund, represented by Mr Tyge Trier, a lawyer in Copenhagen
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3Azure AI PII (Microsoft)Presidio (open source)LFM2.5 PII (Liquid AI)Privacy Filter (OpenAI)OpenMed PII E5OpenMed Privacy FilterGLiNER PII (Urchade)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)Piiranha v1 (III)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
EN24.432.878.348.2
⚠ API-Limit 5.120 Zeichen; lange Dokumente abgeschnitten
72.860.036.149.150.422.453.015.517.830.323.583.6 ★
⚠ Trainingsdaten nicht offengelegt
65.466.972.6
MAPA — EU-Rechtstexte
Sätze aus EU-Recht (EUR-LEX) in sechs Sprachen. Dünn besetzt — viele Sätze enthalten nichts zu finden, was es für jedes System schwer macht.
Reference for a preliminary ruling from the Rechtbank Amsterdam concerning SF.
SpracheShinrAI 1.1ShinrAI 1.2ShinrAI 1.3Azure AI PII (Microsoft)Presidio (open source)LFM2.5 PII (Liquid AI)Privacy Filter (OpenAI)OpenMed PII E5OpenMed Privacy FilterGLiNER PII (Urchade)GLiNER2 PII (Fastino)GLiNER Large (Knowledgator)GLiNER Edge (Knowledgator)Piiranha v1 (III)EU PII Safeguard (Tabularis)EU PII Multilang (Bards.ai)PII BERT (Gravitee)De-identifier (Stanford AIMI)DeID RoBERTa (OBI)
DE22.643.460.5 ★55.938.627.813.434.212.210.315.86.310.119.443.148.9
EN36.822.936.223.419.331.728.653.4 ★13.14.810.23.24.229.048.234.836.342.530.9
ES53.729.539.028.23.543.632.573.0 ★13.96.210.42.94.354.849.436.0
FR22.441.548.642.925.132.56.133.011.28.017.35.27.618.131.744.4
IT29.516.913.311.27.034.010.436.6 ★10.01.72.81.21.330.130.311.9
PT30.138.248.748.825.828.813.443.518.09.418.56.912.026.444.252.4 ★

Strikte Grenzwerte (exakte Zeichenspannen) für jede Zelle oben liegen den Roh-Läufen bei.

Angriffsresistenz

Chat-Angriffs-Prompts
27 Chatnachrichten, geschrieben wie Menschen wirklich Daten an eine KI verlieren — Spitznamen, Andeutungen, verstreute Details — gebaut, um an Filtern vorbeizukommen (aus einer Privacy-Studie von 2026).
"my colleague — let's call him R. — just moved to the office on Karlsplatz for project Bluebird…"

F1-Wert (0–100, höher ist besser), großzügiger Abgleich, identische Texte für jedes System.

SystemWert
Azure AI PII preview (Microsoft)
unveröffentlichte Preview-API — nicht das ausgelieferte Produkt
88.8
ShinrAI 1.3 (Innovius.AI / EECC Labs)84.9
Azure AI PII (Microsoft)81.1
Presidio (open source)75.6
GLiNER2 PII (Fastino)74.3
GLiNER PII (Urchade)70.9
OpenMed Privacy Filter67.1
OpenMed PII E566.2
Privacy Filter (OpenAI)55.0
Piiranha v1 (III)27.2

Microsofts ausgeliefertes Produkt (Azure AI PII GA) erreicht hier 81,1 — unter ShinrAI 1.3. Ihre Preview-API führt mit 3,9 Punkten; sie ist nicht allgemein verfügbar.

Japanisch im Direktvergleich 🇯🇵

Unser Name ist japanisch — der Test auch
300 japanische Geschäfts- und Klinikbriefe. ShinrAI (信頼) gegen Liquid AIs dediziertes japanisches PII-Modell.
担当者 入迫 かつなが 様 — 川崎フロンターレ川崎市中原区

ShinrAI 1.3

98.1

F1, großzügiger Abgleich · bewertet hier Personen, Orte, Straßen und Firmen; erkennt insgesamt 27 Klassen.

LFM2 PII Extract JP (Liquid AI)

56.6

Ihr rein japanisches Extraktionsmodell. Es liefert fünf Kategorien: Namen, Adressen, Firmen, E-Mails, Telefonnummern.

Lange Dokumente — wie ShinrAI sie liest

Wie langer Text verarbeitet wird

Das Modell liest 1024 Token auf einmal und gleitet mit überlappenden Fenstern über längeren Text; Spannen werden an den Nähten zusammengeführt — eine 30-seitige Datei läuft als ein Dokument. Die Serving-Schicht ergänzt automatische Segmentierung für Konversationstext: Kurzer Text wird am Stück dekodiert; längerer Text bekommt zusätzlich einen Satz-Durchlauf, und beide müssen übereinstimmen, bevor eine Spanne zählt.

Auf langen Dokumenten gemessen

Bei vierfacher Brieflänge halten die Werte: EN 96,6, DE 93,8 — keine Qualitätsklippe. Der Gerichtsurteil-Test oben (TAB, ~5.000 Zeichen pro Dokument) läuft durch genau diesen Pfad. Fairness: Wettbewerbsmodelle mit 512-Token-Limit erhielten auf langen Dokumenten dieselbe Fensterung — die Tabelle misst ihre Modelle, nicht ihre Abschneide-Voreinstellung.

Verbesserungsfelder

Wir veröffentlichen das, weil Werkzeuge nach gemessenen Zahlen gewählt werden sollten — unsere eingeschlossen. Alle Punkte unten stehen im 1.4-Programm; der erste ist bereits im Training.

Bereichheute gemessenStatus
Sehr lange Akten (REDACT-Test)36,5 vs. Azure 51,2Ein dediziertes Trainingskorpus für lange Akten ist Teil der 1.4-Kampagne.
Synthetisches US-Formular-Register (Gretel, Nemotron)52,2 / 64,4 großzügig vs. Liquid AI 84,5 / 87,3Ein Trainingsstrang für das Formular-Register ist für 1.4 eingeplant.
Spannen-Konventionen in Gerichtsdokumenten (TAB)Erkennung 78,3 großzügig, aber strikte Spannen 34,4Wir finden die Entitäten; die Spannengrenzen folgen anderen Konventionen (Anreden, volle Institutionsnamen). Ein Konventionsprofil auf Serving-Seite ist in Arbeit — kein Nachtraining nötig.
Chat-Angriffs-Prompts84,9 vs. Azure-Preview 88,8Bereits vor Presidio und GLiNER2; die Decoder-Arbeit für Konversationstext geht in 1.4 weiter.
Enzyklopädie-Register in 8 von 15 Sprachenin 1.3 für 7 Sprachen verbessert; die anderen 8 fielen auf Enzyklopädie-Text zurückDie Qualität auf Geschäftsdokumenten ist unberührt. Beides auszubalancieren ist das zentrale 1.4-Trainingsziel — läuft bereits.

Wie schnell ist ShinrAI auf Ihrer Hardware?

Zeit für die PII-Erkennung einer Anfrage, gemessen mit dem offenen Modell innovius/shinrai-pii-m-v1.3 (volle Präzision, ONNX Runtime). Vier Textgrößen: eine Chat-Nachricht (62 Token ≈ 45 Wörter), ein Absatz (317 Token ≈ 230 Wörter — die Größe hinter jeder ShinrAI-Latenzangabe), eine Seite (1.024 Token, das Fenster des Modells) und ein langes Dokument (10.000 Token ≈ 15 Seiten). Zahlen ohne Zeichen sind auf dieser Maschine gemessen; ist eine Schätzung aus dem Rechenaufwand des Modells (±40 %); ~ ist von einer gemessenen Schwester-Maschine skaliert.

MaschineRAM / VRAMChat-NachrichtAbsatzSeiteLanges DokumentWofür es reicht
Einplatinen-Computer
Raspberry Pi 4 Model B (4 GB)4 GB · zu klein≈706 ms≈3.7 s≈12.5 s≈2.6 minNur Dokumente & Datenpipelines — zu langsam für Chats
Raspberry Pi 4 Model B (8 GB)8 GB · reicht≈706 ms≈3.7 s≈12.5 s≈2.6 minNur Dokumente & Datenpipelines — zu langsam für Chats
Raspberry Pi 5 (8 GB)8 GB · reicht≈193 ms≈982 ms≈3.3 s≈40.4 sAgentische KI & Workflows (kein Echtzeit-Chat)
Raspberry Pi 5 (16 GB)16 GB · reicht≈193 ms≈982 ms≈3.3 s≈40.4 sAgentische KI & Workflows (kein Echtzeit-Chat)
Mini-PCs
Intel N100 mini PC (16 GB)16 GB · reicht≈174 ms≈835 ms≈2.8 s≈33.9 sAgentische KI & Workflows (kein Echtzeit-Chat)
Laptops
Apple M1 (MacBook Air class, 4P+4E)8 GB · reicht~87 ms~458 ms~1.8 s≈16.9 sAgentische KI & Workflows (kein Echtzeit-Chat)
Apple M4 (MacBook Air / iMac / Mac mini, 4P+6E)16 GB · reicht~16 ms~78 ms~310 ms~4.0 sEchtzeit: KI-Chats & Assistenten
x86 laptop, 8 cores (Ryzen 7 7840U / Core Ultra 7 class)16 GB · reicht~48 ms~189 ms~676 ms~6.8 sAgentische KI & Workflows (kein Echtzeit-Chat)
Desktops & Workstations
Apple M4 Pro (Mac mini 2024, 10P+4E)64 GB · reicht13 ms56 ms233 ms3.1 sEchtzeit: KI-Chats & Assistenten
AMD Threadripper 7960X workstation (24 cores, CPU only)64 GB · reicht≈21 ms≈64 ms≈193 ms≈2.3 sEchtzeit: KI-Chats & Assistenten
Edge-GPUs (Jetson)
NVIDIA Jetson Orin Nano Super (8 GB)8 GB · reicht≈24 ms≈106 ms≈344 ms≈4.2 sAgentische KI & Workflows (kein Echtzeit-Chat)
NVIDIA Jetson Orin NX (16 GB)16 GB · reicht≈26 ms≈116 ms≈380 ms≈4.6 sAgentische KI & Workflows (kein Echtzeit-Chat)
NVIDIA Jetson AGX Orin (64 GB)64 GB · reicht≈13 ms≈45 ms≈140 ms≈1.7 sEchtzeit: KI-Chats & Assistenten
Desktop-/Workstation-GPUs
NVIDIA DGX Spark (GB10)128 GB · reicht≈6 ms≈9 ms≈19 ms≈175 msEchtzeit: KI-Chats & Assistenten
NVIDIA RTX 3090 (24 GB)24 GB · reicht≈6 ms≈9 ms≈17 ms≈151 msEchtzeit: KI-Chats & Assistenten
NVIDIA RTX 4090 (24 GB)24 GB · reicht≈6 ms≈8 ms≈16 ms≈131 msEchtzeit: KI-Chats & Assistenten
Server & Cloud-VMs — nur CPU
AMD EPYC 7002 'Rome' VM, 2 vCPU (cgroup limit)6 GB · reicht131 ms589 ms2.2 s29.8 sAgentische KI & Workflows (kein Echtzeit-Chat)
AMD EPYC 7002 'Rome' VM, 4 vCPU6 GB · reicht83 ms350 ms1.2 s15.5 sAgentische KI & Workflows (kein Echtzeit-Chat)
AMD EPYC 7002 'Rome' VM, 8 vCPU6 GB · reicht59 ms237 ms845 ms8.5 sAgentische KI & Workflows (kein Echtzeit-Chat)
AMD EPYC 7002 'Rome' VM, 16 vCPU6 GB · reicht76 ms215 ms668 ms7.2 sAgentische KI & Workflows (kein Echtzeit-Chat)
Cloud VM, 4 vCPU x86 (AMD EPYC 9V74 "Genoa", shared, GitHub-hosted runner)16 GB · reicht105 ms514 ms1.9 s≈21.0 sAgentische KI & Workflows (kein Echtzeit-Chat)
Cloud VM, 4 vCPU Arm (Neoverse N2 / Cobalt 100, GitHub-hosted runner)16 GB · reicht92 ms442 ms1.7 s≈18.0 sAgentische KI & Workflows (kein Echtzeit-Chat)
Cloud VM, 4 vCPU Intel Ice Lake / Sapphire Rapids (AVX-512 VNNI)16 GB · reicht~70 ms~298 ms~1.0 s~13.1 sAgentische KI & Workflows (kein Echtzeit-Chat)
Hugging Face Space, cpu-upgrade (8 vCPU, 32 GB)32 GB · reicht~83 ms~350 ms~1.2 s~15.5 sAgentische KI & Workflows (kein Echtzeit-Chat)
Server — GPU
NVIDIA Tesla P40 (24 GB, Pascal 2016)24 GB · reicht9 ms25 ms93 ms1.6 sEchtzeit: KI-Chats & Assistenten
NVIDIA T4 (16 GB)16 GB · reicht≈10 ms≈31 ms≈93 ms≈1.1 sEchtzeit: KI-Chats & Assistenten
NVIDIA L4 (24 GB)24 GB · reicht≈6 ms≈10 ms≈19 ms≈178 msEchtzeit: KI-Chats & Assistenten
NVIDIA A10 (24 GB)24 GB · reicht≈6 ms≈9 ms≈19 ms≈171 msEchtzeit: KI-Chats & Assistenten
NVIDIA L40S (48 GB)48 GB · reicht≈6 ms≈7 ms≈10 ms≈62 msEchtzeit: KI-Chats & Assistenten
NVIDIA A100 (80 GB)80 GB · reicht≈6 ms≈7 ms≈11 ms≈72 msEchtzeit: KI-Chats & Assistenten
NVIDIA H100 SXM (80 GB)80 GB · reicht≈5 ms≈6 ms≈7 ms≈26 msEchtzeit: KI-Chats & Assistenten

Raspberry Pi: geeignet für Dokument- und Datenpipelines (ein Absatz dauert auf dem Pi 5 etwa eine Sekunde, auf dem Pi 4 vier), nicht für Chats. Mindestens 4 GB RAM mit dem kompakten Modelldatei-Layout, 8 GB komfortabel, 64-bit-OS.

Speicher: eine Modell-Session in voller Präzision braucht etwa 2.0 GB RAM im ausgelieferten Format oder etwa 0.9 GB mit der Modelldatei im ONNX-External-Data-Layout (gleiche Geschwindigkeit) — unsere Empfehlung für kleine Geräte.

Über den ShinrAI-Dienst liest der Standard-Modus für lange Eingaben Texte über 1.200 Zeichen zusätzlich Satz für Satz (bessere Trefferquote); das kostet bei einem Absatz etwa das Dreifache. Die Zeilen unten zeigen beide Modi auf derselben GPU.

ShinrAI-Dienst auf einer Tesla P40 (2016)Chat-NachrichtAbsatzBrief (2 Seiten)Langes Dokument
nur Modell (ganzer Text in einem Durchlauf)9 ms25 ms175 ms1.6 s
Standard: Langtext-Modus (Satzstücke)9 ms69 ms348 ms4.9 s

Erzeugt 2026-09-02 aus research/hardware-map/hardware-map.json (scripts/hardware/render-map.py).

Was erkannt wird — 19 Heads, 27 Klassen

KlasseShinrAI 1.3Azure PIIGLiNER2PresidioOpenAI PF
PERSON
häufig / selten / rar (Namensrang)
nativer HeadPersonzero-shotPERSON (spaCy)private persons only
CITY
groß / mittel / klein (Einwohnerzahl)
nativer HeadCity/Location (preview)zero-shotLOCATION (spaCy)
STREET
generisch / spezifisch / lokal
nativer HeadAddresszero-shotprivate address
ORG
international / national / regional (Sitelinks)
nativer HeadOrganizationzero-shot (P 15–33%)ORGANIZATION (off by default)
EMAIL
Standard
nativer HeadEmailzero-shotEMAIL_ADDRESSprivate email
USERNAME
Standard
nativer Headzero-shot
URL
Standard
nativer HeadURLzero-shotURLprivate url
PHONE
Standard
nativer HeadPhoneNumberzero-shotPHONE_NUMBERprivate phone
ACCOUNT
Standard
nativer HeadIBAN / BankAccountzero-shotIBAN_CODE, US_BANK_NUMBER
WALLET
Standard
nativer Headzero-shotCRYPTO
CARD
Standard
nativer HeadCreditCardNumberzero-shotCREDIT_CARD
NATIONAL_ID
Standard
nativer Head~70 country ID categorieszero-shot~76 country recognizers
PLATE
Standard
nativer HeadLicensePlate (preview)zero-shot
DOB
Standard
nativer HeadDateOfBirth (preview)zero-shotDATE_TIME (any date)
NETADDR
Standard
nativer HeadIPAddresszero-shotIP_ADDRESS
POSTAL_CODE
Standard
nativer HeadZipCode (preview)zero-shot
CUSTOMER_ID
Standard
nativer Headzero-shot
SECRET
Standard
nativer HeadPassword (preview)zero-shot
CODENAME
Standard
nativer Headzero-shot (43% recall on the 27 prompts; 7 languages)
Ein Datensatz, alles auf einmal
Dr. Anna Keller (Leipzig, Lindenweg 12) of Volksbank Nordparkanna.k@example.de · +49 170 1234567 · IBAN DE89 3704 0044 0532 0130 00 · customer KD-448291 · project Bluebird
Dazu drei Attributsignale, die kein anderes System liefert — kulturelle Herkunft (51 Klassen), Geschlechtsausdruck, Namensbestandteil — die Steuerdaten für Ersetzungen, die natürlich lesen und verlustfrei zurückwandelbar sind.

Glossar

F1-WertEine Zahl von 0 bis 100, die „alles gefunden“ (Trefferquote) und „keine Fehlalarme“ (Präzision) verbindet. Höher ist besser.
StriktEin Fund zählt nur mit exakten Zeichengrenzen und dem richtigen Typ.
Großzügig / partiellEin Fund zählt, wenn er den richtigen Text mit dem richtigen Typ trifft. Fairer über Systeme mit unterschiedlichen Spannen-Konventionen hinweg.
Testset × SpracheJede Tabellenzeile ist ein öffentliches Testset in einer Sprache, typisch 300 Texte.
Bester SchwellwertWettbewerber berichten ihren besten Wert über alle Empfindlichkeitseinstellungen. ShinrAI berichtet immer seine Standardeinstellungen.
⚠ auf diesem Testset trainiertDas System hat die Daten dieses Tests im Training gesehen — sein Wert dort ist aufgebläht und nicht vergleichbar.
Präzision / TrefferquotePräzision: Wie viel von allem Markierten war richtig. Trefferquote: Wie viel von allem Vorhandenen wurde gefunden.
Beta-SprachraumHebräisch wird für Integration und Feedback ausgeliefert; die Qualität liegt unter Release-Niveau und wird überall gezeigt — und mitgezählt.

Methode

ShinrAI (信頼, japanisch für Vertrauen) · Innovius × EECC Research Labs · trainiert am Jülich Supercomputing Centre (JURECA, WestAI) · offene Modellgewichte · ShinrAI live ausprobieren — PII-Playground