Wie gut funktionieren PII-Detektoren wirklich? Wir messen unsere eigenen Releases und das gesamte Feld auf denselben Texten, mit derselben Bewertung — und veröffentlichen alles, auch dort, wo wir zurückliegen.
Die erste offene Generation (2026). Weiterhin als Archiv verfügbar.
Größere Inventare, 1024-Token-Fenster. Archiv.
Das aktuelle Release: Identifier-Formate im Modell, Herkunftsattribut mit 51 Klassen, Japanisch auf bestem Stand.
Ausblick: ShinrAI 1.4 ist im Training — Schwärzung langer Dokumente, das Formular-Register, Hebräisch Richtung Vollunterstützung.
Die Spalten „ShinrAI 1.3“ zeigen das offene Modell hinter unseren Standard-Serving-Einstellungen — die Zahl, die zählt. Das Enterprise-Produkt legt zusätzliche regelbasierte Erkennung darüber (Prüfsummen-Validatoren, deterministische Identifier); diese Schicht ist konstruktionsbedingt exakt und nicht Teil dieser Werte.
F1-Wert (0–100, höher ist besser · exakte Spannen). 200 Texte je Sprachraum. Der Median von 95.0 schließt das hebräische Beta ein. Azure AI PII, gemessen auf denselben Texten: 53–76.
| Land | Sprache | Wert | F1 | Präzision / Trefferquote |
|---|---|---|---|---|
| 🇯🇵 | JA | 98.1 | 98.3 / 97.8 | |
| 🇬🇧🇺🇸 | EN | 97.7 | 97.2 / 98.1 | |
| 🇧🇷 | PT-BR | 97.3 | 97.7 / 96.9 | |
| 🇪🇸 | ES | 96.9 | 97.2 / 96.6 | |
| 🇷🇺 | RU | 96.4 | 96.2 / 96.7 | |
| 🇫🇷 | FR | 96.0 | 96.3 / 95.8 | |
| 🇰🇷 | KO | 95.5 | 95.9 / 95.2 | |
| 🇮🇹 | IT | 95.0 | 96.3 / 93.8 | |
| 🇩🇪🇦🇹🇨🇭 | DE | 94.4 | 95.3 / 93.5 | |
| 🇵🇹 | PT-PT | 94.2 | 95.3 / 93.1 | |
| 🇵🇱 | PL | 90.9 | 91.4 / 90.3 | |
| 🇹🇷 | TR | 90.1 | 90.7 / 89.5 | |
| 🇸🇦 | AR | 87.9 | 90.3 / 85.6 | |
| 🇺🇦 | UA | 86.7 | 89.2 / 84.3 | |
| 🇮🇱 | HE Beta | 59.5 | 68.8 / 52.3 |
Das Land zählt: Das Modell weiß, wie ein Straßenname in Frankreich gegenüber Spanien aussieht — und wie ein Firmenname in Japan. Erkennung und Ersetzungen folgen den Konventionen jedes Landes.
Jeder Wettbewerber läuft an seinem besten Schwellwert; ShinrAI läuft mit Standardeinstellungen. Werte sind F1 (0–100, höher ist besser) mit großzügigem Abgleich — ein Fund zählt, wenn er den richtigen Text mit dem richtigen Typ trifft (siehe Glossar). ★ markiert das beste System je Zeile. ⚠ markiert Systeme, die auf genau diesem Testset trainiert haben.
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | LFM2.5 PII (Liquid AI) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 81.5 | 83.6 | 85.4 | 69.4 | 35.6 | 11.0 | 21.3 | 90.3 ★ ⚠ Trainingsüberschneidung wahrscheinlich | 77.8 | — | — | — |
| EN | 80.5 | 75.5 | 80.8 | 76.7 | 38.3 | 10.9 | 21.1 | 86.9 ★ ⚠ Trainingsüberschneidung wahrscheinlich | 70.2 | 68.4 | 50.0 | 69.1 |
| FR | 80.7 | 82.4 | 82.6 | 74.5 | 37.9 | 9.7 | 16.2 | 90.6 ★ ⚠ Trainingsüberschneidung wahrscheinlich | 75.9 | — | — | — |
| IT | 76.5 | 77.6 | 83.3 | 70.9 | 45.2 | 13.1 | 25.3 | 89.0 ★ ⚠ Trainingsüberschneidung wahrscheinlich | 73.8 | — | — | — |
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | LFM2.5 PII (Liquid AI) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 72.8 | 78.1 | 92.1 ★ | 62.3 | 45.6 | 25.7 | 37.9 | 58.5 | 91.3 ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| EN | 79.3 | 83.2 | 94.9 | 60.9 | 45.8 | 17.3 | 28.5 | 58.7 | 96.2 ★ ⚠ Trainingsdaten nicht offengelegt | 86.9 | 65.1 | 86.5 |
| ES | 85.6 | 73.5 | 97.7 ★ | 61.5 | 39.0 | 16.5 | 29.5 | 64.4 | 93.3 ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| FR | 84.1 | 72.8 | 93.3 ★ | 61.7 | 40.2 | 16.5 | 26.9 | 61.4 | 90.3 ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| IT | 88.5 | 67.8 | 96.8 ★ | 56.2 | 33.9 | 11.8 | 21.7 | 60.4 | 91.4 ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| PL | 74.7 | 73.5 | 81.2 | 65.9 | 32.3 | 20.1 | 23.7 | 45.7 | 87.8 ★ ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| PT | 81.0 | 73.3 | 94.7 | 62.7 | 38.4 | 15.4 | 28.8 | 61.0 | 96.1 ★ ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| RU | 71.1 | 70.5 | 82.5 ★ | 53.9 | 34.9 | 17.9 | 18.1 | 51.5 | 82.5 ★ ⚠ Trainingsdaten nicht offengelegt | — | — | — |
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 24.1 | 25.4 | 52.2 | 30.7 | 44.2 | 84.5 ★ | 34.0 | 78.1 | 74.3 | 24.3 | 54.6 | 24.8 | 23.5 | 51.4 | 60.0 | 53.9 | 46.4 | 37.3 | 39.7 |
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 25.1 | 42.2 | 64.4 | 46.5 | 57.5 | 87.3 | 54.6 | 93.9 ★ ⚠ auf diesem Testset trainiert | 89.6 | 12.9 | 49.7 | 11.0 | 10.9 | 64.8 | 65.5 | 68.0 | 68.3 | 41.2 | 48.7 |
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 24.4 | 32.8 | 78.3 | 48.2 ⚠ API-Limit 5.120 Zeichen; lange Dokumente abgeschnitten | 72.8 | 60.0 | 36.1 | 49.1 | 50.4 | 22.4 | 53.0 | 15.5 | 17.8 | 30.3 | 23.5 | 83.6 ★ ⚠ Trainingsdaten nicht offengelegt | 65.4 | 66.9 | 72.6 |
| Sprache | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 22.6 | 43.4 | 60.5 ★ | 55.9 | 38.6 | 27.8 | 13.4 | 34.2 | 12.2 | 10.3 | 15.8 | 6.3 | 10.1 | 19.4 | 43.1 | 48.9 | — | — | — |
| EN | 36.8 | 22.9 | 36.2 | 23.4 | 19.3 | 31.7 | 28.6 | 53.4 ★ | 13.1 | 4.8 | 10.2 | 3.2 | 4.2 | 29.0 | 48.2 | 34.8 | 36.3 | 42.5 | 30.9 |
| ES | 53.7 | 29.5 | 39.0 | 28.2 | 3.5 | 43.6 | 32.5 | 73.0 ★ | 13.9 | 6.2 | 10.4 | 2.9 | 4.3 | 54.8 | 49.4 | 36.0 | — | — | — |
| FR | 22.4 | 41.5 | 48.6 | 42.9 | 25.1 | 32.5 | 6.1 | 33.0 | 11.2 | 8.0 | 17.3 | 5.2 | 7.6 | 18.1 | 31.7 | 44.4 | — | — | — |
| IT | 29.5 | 16.9 | 13.3 | 11.2 | 7.0 | 34.0 | 10.4 | 36.6 ★ | 10.0 | 1.7 | 2.8 | 1.2 | 1.3 | 30.1 | 30.3 | 11.9 | — | — | — |
| PT | 30.1 | 38.2 | 48.7 | 48.8 | 25.8 | 28.8 | 13.4 | 43.5 | 18.0 | 9.4 | 18.5 | 6.9 | 12.0 | 26.4 | 44.2 | 52.4 ★ | — | — | — |
Strikte Grenzwerte (exakte Zeichenspannen) für jede Zelle oben liegen den Roh-Läufen bei.
F1-Wert (0–100, höher ist besser), großzügiger Abgleich, identische Texte für jedes System.
| System | Wert |
|---|---|
| Azure AI PII preview (Microsoft) unveröffentlichte Preview-API — nicht das ausgelieferte Produkt | 88.8 |
| ShinrAI 1.3 (Innovius.AI / EECC Labs) | 84.9 |
| Azure AI PII (Microsoft) | 81.1 |
| Presidio (open source) | 75.6 |
| GLiNER2 PII (Fastino) | 74.3 |
| GLiNER PII (Urchade) | 70.9 |
| OpenMed Privacy Filter | 67.1 |
| OpenMed PII E5 | 66.2 |
| Privacy Filter (OpenAI) | 55.0 |
| Piiranha v1 (III) | 27.2 |
Microsofts ausgeliefertes Produkt (Azure AI PII GA) erreicht hier 81,1 — unter ShinrAI 1.3. Ihre Preview-API führt mit 3,9 Punkten; sie ist nicht allgemein verfügbar.
F1, großzügiger Abgleich · bewertet hier Personen, Orte, Straßen und Firmen; erkennt insgesamt 27 Klassen.
Ihr rein japanisches Extraktionsmodell. Es liefert fünf Kategorien: Namen, Adressen, Firmen, E-Mails, Telefonnummern.
Das Modell liest 1024 Token auf einmal und gleitet mit überlappenden Fenstern über längeren Text; Spannen werden an den Nähten zusammengeführt — eine 30-seitige Datei läuft als ein Dokument. Die Serving-Schicht ergänzt automatische Segmentierung für Konversationstext: Kurzer Text wird am Stück dekodiert; längerer Text bekommt zusätzlich einen Satz-Durchlauf, und beide müssen übereinstimmen, bevor eine Spanne zählt.
Bei vierfacher Brieflänge halten die Werte: EN 96,6, DE 93,8 — keine Qualitätsklippe. Der Gerichtsurteil-Test oben (TAB, ~5.000 Zeichen pro Dokument) läuft durch genau diesen Pfad. Fairness: Wettbewerbsmodelle mit 512-Token-Limit erhielten auf langen Dokumenten dieselbe Fensterung — die Tabelle misst ihre Modelle, nicht ihre Abschneide-Voreinstellung.
Wir veröffentlichen das, weil Werkzeuge nach gemessenen Zahlen gewählt werden sollten — unsere eingeschlossen. Alle Punkte unten stehen im 1.4-Programm; der erste ist bereits im Training.
| Bereich | heute gemessen | Status |
|---|---|---|
| Sehr lange Akten (REDACT-Test) | 36,5 vs. Azure 51,2 | Ein dediziertes Trainingskorpus für lange Akten ist Teil der 1.4-Kampagne. |
| Synthetisches US-Formular-Register (Gretel, Nemotron) | 52,2 / 64,4 großzügig vs. Liquid AI 84,5 / 87,3 | Ein Trainingsstrang für das Formular-Register ist für 1.4 eingeplant. |
| Spannen-Konventionen in Gerichtsdokumenten (TAB) | Erkennung 78,3 großzügig, aber strikte Spannen 34,4 | Wir finden die Entitäten; die Spannengrenzen folgen anderen Konventionen (Anreden, volle Institutionsnamen). Ein Konventionsprofil auf Serving-Seite ist in Arbeit — kein Nachtraining nötig. |
| Chat-Angriffs-Prompts | 84,9 vs. Azure-Preview 88,8 | Bereits vor Presidio und GLiNER2; die Decoder-Arbeit für Konversationstext geht in 1.4 weiter. |
| Enzyklopädie-Register in 8 von 15 Sprachen | in 1.3 für 7 Sprachen verbessert; die anderen 8 fielen auf Enzyklopädie-Text zurück | Die Qualität auf Geschäftsdokumenten ist unberührt. Beides auszubalancieren ist das zentrale 1.4-Trainingsziel — läuft bereits. |
Zeit für die PII-Erkennung einer Anfrage, gemessen mit dem offenen Modell innovius/shinrai-pii-m-v1.3 (volle Präzision, ONNX Runtime). Vier Textgrößen: eine Chat-Nachricht (62 Token ≈ 45 Wörter), ein Absatz (317 Token ≈ 230 Wörter — die Größe hinter jeder ShinrAI-Latenzangabe), eine Seite (1.024 Token, das Fenster des Modells) und ein langes Dokument (10.000 Token ≈ 15 Seiten). Zahlen ohne Zeichen sind auf dieser Maschine gemessen; ≈ ist eine Schätzung aus dem Rechenaufwand des Modells (±40 %); ~ ist von einer gemessenen Schwester-Maschine skaliert.
| Maschine | RAM / VRAM | Chat-Nachricht | Absatz | Seite | Langes Dokument | Wofür es reicht |
|---|---|---|---|---|---|---|
| Einplatinen-Computer | ||||||
| Raspberry Pi 4 Model B (4 GB) | 4 GB · zu klein | ≈706 ms | ≈3.7 s | ≈12.5 s | ≈2.6 min | Nur Dokumente & Datenpipelines — zu langsam für Chats |
| Raspberry Pi 4 Model B (8 GB) | 8 GB · reicht | ≈706 ms | ≈3.7 s | ≈12.5 s | ≈2.6 min | Nur Dokumente & Datenpipelines — zu langsam für Chats |
| Raspberry Pi 5 (8 GB) | 8 GB · reicht | ≈193 ms | ≈982 ms | ≈3.3 s | ≈40.4 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Raspberry Pi 5 (16 GB) | 16 GB · reicht | ≈193 ms | ≈982 ms | ≈3.3 s | ≈40.4 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Mini-PCs | ||||||
| Intel N100 mini PC (16 GB) | 16 GB · reicht | ≈174 ms | ≈835 ms | ≈2.8 s | ≈33.9 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Laptops | ||||||
| Apple M1 (MacBook Air class, 4P+4E) | 8 GB · reicht | ~87 ms | ~458 ms | ~1.8 s | ≈16.9 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Apple M4 (MacBook Air / iMac / Mac mini, 4P+6E) | 16 GB · reicht | ~16 ms | ~78 ms | ~310 ms | ~4.0 s | Echtzeit: KI-Chats & Assistenten |
| x86 laptop, 8 cores (Ryzen 7 7840U / Core Ultra 7 class) | 16 GB · reicht | ~48 ms | ~189 ms | ~676 ms | ~6.8 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Desktops & Workstations | ||||||
| Apple M4 Pro (Mac mini 2024, 10P+4E) | 64 GB · reicht | 13 ms | 56 ms | 233 ms | 3.1 s | Echtzeit: KI-Chats & Assistenten |
| AMD Threadripper 7960X workstation (24 cores, CPU only) | 64 GB · reicht | ≈21 ms | ≈64 ms | ≈193 ms | ≈2.3 s | Echtzeit: KI-Chats & Assistenten |
| Edge-GPUs (Jetson) | ||||||
| NVIDIA Jetson Orin Nano Super (8 GB) | 8 GB · reicht | ≈24 ms | ≈106 ms | ≈344 ms | ≈4.2 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| NVIDIA Jetson Orin NX (16 GB) | 16 GB · reicht | ≈26 ms | ≈116 ms | ≈380 ms | ≈4.6 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| NVIDIA Jetson AGX Orin (64 GB) | 64 GB · reicht | ≈13 ms | ≈45 ms | ≈140 ms | ≈1.7 s | Echtzeit: KI-Chats & Assistenten |
| Desktop-/Workstation-GPUs | ||||||
| NVIDIA DGX Spark (GB10) | 128 GB · reicht | ≈6 ms | ≈9 ms | ≈19 ms | ≈175 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA RTX 3090 (24 GB) | 24 GB · reicht | ≈6 ms | ≈9 ms | ≈17 ms | ≈151 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA RTX 4090 (24 GB) | 24 GB · reicht | ≈6 ms | ≈8 ms | ≈16 ms | ≈131 ms | Echtzeit: KI-Chats & Assistenten |
| Server & Cloud-VMs — nur CPU | ||||||
| AMD EPYC 7002 'Rome' VM, 2 vCPU (cgroup limit) | 6 GB · reicht | 131 ms | 589 ms | 2.2 s | 29.8 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| AMD EPYC 7002 'Rome' VM, 4 vCPU | 6 GB · reicht | 83 ms | 350 ms | 1.2 s | 15.5 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| AMD EPYC 7002 'Rome' VM, 8 vCPU | 6 GB · reicht | 59 ms | 237 ms | 845 ms | 8.5 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| AMD EPYC 7002 'Rome' VM, 16 vCPU | 6 GB · reicht | 76 ms | 215 ms | 668 ms | 7.2 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Cloud VM, 4 vCPU x86 (AMD EPYC 9V74 "Genoa", shared, GitHub-hosted runner) | 16 GB · reicht | 105 ms | 514 ms | 1.9 s | ≈21.0 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Cloud VM, 4 vCPU Arm (Neoverse N2 / Cobalt 100, GitHub-hosted runner) | 16 GB · reicht | 92 ms | 442 ms | 1.7 s | ≈18.0 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Cloud VM, 4 vCPU Intel Ice Lake / Sapphire Rapids (AVX-512 VNNI) | 16 GB · reicht | ~70 ms | ~298 ms | ~1.0 s | ~13.1 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Hugging Face Space, cpu-upgrade (8 vCPU, 32 GB) | 32 GB · reicht | ~83 ms | ~350 ms | ~1.2 s | ~15.5 s | Agentische KI & Workflows (kein Echtzeit-Chat) |
| Server — GPU | ||||||
| NVIDIA Tesla P40 (24 GB, Pascal 2016) | 24 GB · reicht | 9 ms | 25 ms | 93 ms | 1.6 s | Echtzeit: KI-Chats & Assistenten |
| NVIDIA T4 (16 GB) | 16 GB · reicht | ≈10 ms | ≈31 ms | ≈93 ms | ≈1.1 s | Echtzeit: KI-Chats & Assistenten |
| NVIDIA L4 (24 GB) | 24 GB · reicht | ≈6 ms | ≈10 ms | ≈19 ms | ≈178 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA A10 (24 GB) | 24 GB · reicht | ≈6 ms | ≈9 ms | ≈19 ms | ≈171 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA L40S (48 GB) | 48 GB · reicht | ≈6 ms | ≈7 ms | ≈10 ms | ≈62 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA A100 (80 GB) | 80 GB · reicht | ≈6 ms | ≈7 ms | ≈11 ms | ≈72 ms | Echtzeit: KI-Chats & Assistenten |
| NVIDIA H100 SXM (80 GB) | 80 GB · reicht | ≈5 ms | ≈6 ms | ≈7 ms | ≈26 ms | Echtzeit: KI-Chats & Assistenten |
Raspberry Pi: geeignet für Dokument- und Datenpipelines (ein Absatz dauert auf dem Pi 5 etwa eine Sekunde, auf dem Pi 4 vier), nicht für Chats. Mindestens 4 GB RAM mit dem kompakten Modelldatei-Layout, 8 GB komfortabel, 64-bit-OS.
Speicher: eine Modell-Session in voller Präzision braucht etwa 2.0 GB RAM im ausgelieferten Format oder etwa 0.9 GB mit der Modelldatei im ONNX-External-Data-Layout (gleiche Geschwindigkeit) — unsere Empfehlung für kleine Geräte.
Über den ShinrAI-Dienst liest der Standard-Modus für lange Eingaben Texte über 1.200 Zeichen zusätzlich Satz für Satz (bessere Trefferquote); das kostet bei einem Absatz etwa das Dreifache. Die Zeilen unten zeigen beide Modi auf derselben GPU.
| ShinrAI-Dienst auf einer Tesla P40 (2016) | Chat-Nachricht | Absatz | Brief (2 Seiten) | Langes Dokument |
|---|---|---|---|---|
| nur Modell (ganzer Text in einem Durchlauf) | 9 ms | 25 ms | 175 ms | 1.6 s |
| Standard: Langtext-Modus (Satzstücke) | 9 ms | 69 ms | 348 ms | 4.9 s |
Erzeugt 2026-09-02 aus research/hardware-map/hardware-map.json (scripts/hardware/render-map.py).
| Klasse | ShinrAI 1.3 | Azure PII | GLiNER2 | Presidio | OpenAI PF |
|---|---|---|---|---|---|
| PERSON häufig / selten / rar (Namensrang) | nativer Head | Person | zero-shot | PERSON (spaCy) | private persons only |
| CITY groß / mittel / klein (Einwohnerzahl) | nativer Head | City/Location (preview) | zero-shot | LOCATION (spaCy) | — |
| STREET generisch / spezifisch / lokal | nativer Head | Address | zero-shot | — | private address |
| ORG international / national / regional (Sitelinks) | nativer Head | Organization | zero-shot (P 15–33%) | ORGANIZATION (off by default) | — |
| EMAIL Standard | nativer Head | zero-shot | EMAIL_ADDRESS | private email | |
| USERNAME Standard | nativer Head | — | zero-shot | — | — |
| URL Standard | nativer Head | URL | zero-shot | URL | private url |
| PHONE Standard | nativer Head | PhoneNumber | zero-shot | PHONE_NUMBER | private phone |
| ACCOUNT Standard | nativer Head | IBAN / BankAccount | zero-shot | IBAN_CODE, US_BANK_NUMBER | — |
| WALLET Standard | nativer Head | — | zero-shot | CRYPTO | — |
| CARD Standard | nativer Head | CreditCardNumber | zero-shot | CREDIT_CARD | — |
| NATIONAL_ID Standard | nativer Head | ~70 country ID categories | zero-shot | ~76 country recognizers | — |
| PLATE Standard | nativer Head | LicensePlate (preview) | zero-shot | — | — |
| DOB Standard | nativer Head | DateOfBirth (preview) | zero-shot | DATE_TIME (any date) | — |
| NETADDR Standard | nativer Head | IPAddress | zero-shot | IP_ADDRESS | — |
| POSTAL_CODE Standard | nativer Head | ZipCode (preview) | zero-shot | — | — |
| CUSTOMER_ID Standard | nativer Head | — | zero-shot | — | — |
| SECRET Standard | nativer Head | Password (preview) | zero-shot | — | — |
| CODENAME Standard | nativer Head | — | zero-shot (43% recall on the 27 prompts; 7 languages) | — | — |
| F1-Wert | Eine Zahl von 0 bis 100, die „alles gefunden“ (Trefferquote) und „keine Fehlalarme“ (Präzision) verbindet. Höher ist besser. |
| Strikt | Ein Fund zählt nur mit exakten Zeichengrenzen und dem richtigen Typ. |
| Großzügig / partiell | Ein Fund zählt, wenn er den richtigen Text mit dem richtigen Typ trifft. Fairer über Systeme mit unterschiedlichen Spannen-Konventionen hinweg. |
| Testset × Sprache | Jede Tabellenzeile ist ein öffentliches Testset in einer Sprache, typisch 300 Texte. |
| Bester Schwellwert | Wettbewerber berichten ihren besten Wert über alle Empfindlichkeitseinstellungen. ShinrAI berichtet immer seine Standardeinstellungen. |
| ⚠ auf diesem Testset trainiert | Das System hat die Daten dieses Tests im Training gesehen — sein Wert dort ist aufgebläht und nicht vergleichbar. |
| Präzision / Trefferquote | Präzision: Wie viel von allem Markierten war richtig. Trefferquote: Wie viel von allem Vorhandenen wurde gefunden. |
| Beta-Sprachraum | Hebräisch wird für Integration und Feedback ausgeliefert; die Qualität liegt unter Release-Niveau und wird überall gezeigt — und mitgezählt. |
ShinrAI (信頼, japanisch für Vertrauen) · Innovius × EECC Research Labs · trainiert am Jülich Supercomputing Centre (JURECA, WestAI) · offene Modellgewichte · ShinrAI live ausprobieren — PII-Playground