PII検出器は実際どこまで機能するのか。私たちは自社のリリースと他社システムを同じテキスト・同じ採点で測定し、劣っている箇所も含めてすべてを公開します。
最初の公開世代(2026年)。アーカイブとして引き続き利用可能。
拡充された辞書資産、1024トークン窓。アーカイブ。
現行リリース:識別子フォーマットをモデルに内蔵、51クラスの出自属性、日本語は過去最高水準。
今後の予定:ShinrAI 1.4 を訓練中 — 長文書の黒塗り、書式文書レジスタ、ヘブライ語の正式対応へ。
「ShinrAI 1.3」列は、標準サービング設定で動く公開モデルの値 — これが本当に意味のある数字です。エンタープライズ製品はその上にルールベース検出(チェックサム検証、確定的識別子)を重ねます。この層は構造上厳密であり、本スコアには含まれません。
F1スコア(0–100、高いほど良い · 厳密スパン)。各ロケール200テキスト。中央値 95.0 はヘブライ語ベータを含みます。同じテキストで測定したAzure AI PII:53–76。
| 国 | 言語 | スコア | F1 | 適合率 / 再現率 |
|---|---|---|---|---|
| 🇯🇵 | JA | 98.1 | 98.3 / 97.8 | |
| 🇬🇧🇺🇸 | EN | 97.7 | 97.2 / 98.1 | |
| 🇧🇷 | PT-BR | 97.3 | 97.7 / 96.9 | |
| 🇪🇸 | ES | 96.9 | 97.2 / 96.6 | |
| 🇷🇺 | RU | 96.4 | 96.2 / 96.7 | |
| 🇫🇷 | FR | 96.0 | 96.3 / 95.8 | |
| 🇰🇷 | KO | 95.5 | 95.9 / 95.2 | |
| 🇮🇹 | IT | 95.0 | 96.3 / 93.8 | |
| 🇩🇪🇦🇹🇨🇭 | DE | 94.4 | 95.3 / 93.5 | |
| 🇵🇹 | PT-PT | 94.2 | 95.3 / 93.1 | |
| 🇵🇱 | PL | 90.9 | 91.4 / 90.3 | |
| 🇹🇷 | TR | 90.1 | 90.7 / 89.5 | |
| 🇸🇦 | AR | 87.9 | 90.3 / 85.6 | |
| 🇺🇦 | UA | 86.7 | 89.2 / 84.3 | |
| 🇮🇱 | HE ベータ | 59.5 | 68.8 / 52.3 |
国が重要です。モデルはフランスとスペインで街路名がどう違うか、日本で企業名がどう見えるかを知っています。検出も置換も各国の慣習に従います。
各社システムは自己最良のしきい値で、ShinrAIは標準設定で動作。スコアはF1(0–100、高いほど良い)、寛容マッチング — 正しいテキストに正しいタイプで触れれば検出成立(用語集参照)。★は行ごとの最良システム。⚠は当該テストセットで訓練したシステム。
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | LFM2.5 PII (Liquid AI) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 81.5 | 83.6 | 85.4 | 69.4 | 35.6 | 11.0 | 21.3 | 90.3 ★ ⚠ 訓練データ重複の可能性が高い | 77.8 | — | — | — |
| EN | 80.5 | 75.5 | 80.8 | 76.7 | 38.3 | 10.9 | 21.1 | 86.9 ★ ⚠ 訓練データ重複の可能性が高い | 70.2 | 68.4 | 50.0 | 69.1 |
| FR | 80.7 | 82.4 | 82.6 | 74.5 | 37.9 | 9.7 | 16.2 | 90.6 ★ ⚠ 訓練データ重複の可能性が高い | 75.9 | — | — | — |
| IT | 76.5 | 77.6 | 83.3 | 70.9 | 45.2 | 13.1 | 25.3 | 89.0 ★ ⚠ 訓練データ重複の可能性が高い | 73.8 | — | — | — |
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | LFM2.5 PII (Liquid AI) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 72.8 | 78.1 | 92.1 ★ | 62.3 | 45.6 | 25.7 | 37.9 | 58.5 | 91.3 ⚠ 訓練データ非公開 | — | — | — |
| EN | 79.3 | 83.2 | 94.9 | 60.9 | 45.8 | 17.3 | 28.5 | 58.7 | 96.2 ★ ⚠ 訓練データ非公開 | 86.9 | 65.1 | 86.5 |
| ES | 85.6 | 73.5 | 97.7 ★ | 61.5 | 39.0 | 16.5 | 29.5 | 64.4 | 93.3 ⚠ 訓練データ非公開 | — | — | — |
| FR | 84.1 | 72.8 | 93.3 ★ | 61.7 | 40.2 | 16.5 | 26.9 | 61.4 | 90.3 ⚠ 訓練データ非公開 | — | — | — |
| IT | 88.5 | 67.8 | 96.8 ★ | 56.2 | 33.9 | 11.8 | 21.7 | 60.4 | 91.4 ⚠ 訓練データ非公開 | — | — | — |
| PL | 74.7 | 73.5 | 81.2 | 65.9 | 32.3 | 20.1 | 23.7 | 45.7 | 87.8 ★ ⚠ 訓練データ非公開 | — | — | — |
| PT | 81.0 | 73.3 | 94.7 | 62.7 | 38.4 | 15.4 | 28.8 | 61.0 | 96.1 ★ ⚠ 訓練データ非公開 | — | — | — |
| RU | 71.1 | 70.5 | 82.5 ★ | 53.9 | 34.9 | 17.9 | 18.1 | 51.5 | 82.5 ★ ⚠ 訓練データ非公開 | — | — | — |
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 24.1 | 25.4 | 52.2 | 30.7 | 44.2 | 84.5 ★ | 34.0 | 78.1 | 74.3 | 24.3 | 54.6 | 24.8 | 23.5 | 51.4 | 60.0 | 53.9 | 46.4 | 37.3 | 39.7 |
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 25.1 | 42.2 | 64.4 | 46.5 | 57.5 | 87.3 | 54.6 | 93.9 ★ ⚠ このテストセットで訓練済み | 89.6 | 12.9 | 49.7 | 11.0 | 10.9 | 64.8 | 65.5 | 68.0 | 68.3 | 41.2 | 48.7 |
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EN | 24.4 | 32.8 | 78.3 | 48.2 ⚠ API上限5,120字。長文書は切り詰め | 72.8 | 60.0 | 36.1 | 49.1 | 50.4 | 22.4 | 53.0 | 15.5 | 17.8 | 30.3 | 23.5 | 83.6 ★ ⚠ 訓練データ非公開 | 65.4 | 66.9 | 72.6 |
| 言語 | ShinrAI 1.1 | ShinrAI 1.2 | ShinrAI 1.3 | Azure AI PII (Microsoft) | Presidio (open source) | LFM2.5 PII (Liquid AI) | Privacy Filter (OpenAI) | OpenMed PII E5 | OpenMed Privacy Filter | GLiNER PII (Urchade) | GLiNER2 PII (Fastino) | GLiNER Large (Knowledgator) | GLiNER Edge (Knowledgator) | Piiranha v1 (III) | EU PII Safeguard (Tabularis) | EU PII Multilang (Bards.ai) | PII BERT (Gravitee) | De-identifier (Stanford AIMI) | DeID RoBERTa (OBI) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DE | 22.6 | 43.4 | 60.5 ★ | 55.9 | 38.6 | 27.8 | 13.4 | 34.2 | 12.2 | 10.3 | 15.8 | 6.3 | 10.1 | 19.4 | 43.1 | 48.9 | — | — | — |
| EN | 36.8 | 22.9 | 36.2 | 23.4 | 19.3 | 31.7 | 28.6 | 53.4 ★ | 13.1 | 4.8 | 10.2 | 3.2 | 4.2 | 29.0 | 48.2 | 34.8 | 36.3 | 42.5 | 30.9 |
| ES | 53.7 | 29.5 | 39.0 | 28.2 | 3.5 | 43.6 | 32.5 | 73.0 ★ | 13.9 | 6.2 | 10.4 | 2.9 | 4.3 | 54.8 | 49.4 | 36.0 | — | — | — |
| FR | 22.4 | 41.5 | 48.6 | 42.9 | 25.1 | 32.5 | 6.1 | 33.0 | 11.2 | 8.0 | 17.3 | 5.2 | 7.6 | 18.1 | 31.7 | 44.4 | — | — | — |
| IT | 29.5 | 16.9 | 13.3 | 11.2 | 7.0 | 34.0 | 10.4 | 36.6 ★ | 10.0 | 1.7 | 2.8 | 1.2 | 1.3 | 30.1 | 30.3 | 11.9 | — | — | — |
| PT | 30.1 | 38.2 | 48.7 | 48.8 | 25.8 | 28.8 | 13.4 | 43.5 | 18.0 | 9.4 | 18.5 | 6.9 | 12.0 | 26.4 | 44.2 | 52.4 ★ | — | — | — |
上記全セルの厳密境界スコア(正確な文字スパン)は生の実行ファイルに同梱しています。
F1スコア(0–100、高いほど良い)、寛容マッチング、全システム同一テキスト。
| システム | スコア |
|---|---|
| Azure AI PII preview (Microsoft) 未リリースのプレビューAPI — 出荷済み製品ではありません | 88.8 |
| ShinrAI 1.3 (Innovius.AI / EECC Labs) | 84.9 |
| Azure AI PII (Microsoft) | 81.1 |
| Presidio (open source) | 75.6 |
| GLiNER2 PII (Fastino) | 74.3 |
| GLiNER PII (Urchade) | 70.9 |
| OpenMed Privacy Filter | 67.1 |
| OpenMed PII E5 | 66.2 |
| Privacy Filter (OpenAI) | 55.0 |
| Piiranha v1 (III) | 27.2 |
Microsoftの出荷済み製品(Azure AI PII GA)はここで81.1 — ShinrAI 1.3を下回ります。プレビューAPIは3.9ポイント先行していますが、一般提供されていません。
F1、寛容マッチング · 本テストでは人名・地名・街路・企業を採点。全体では27クラスを検出。
同社の日本語専用抽出モデル。出力は5カテゴリ:氏名、住所、企業、メール、電話番号。
モデルは一度に1024トークンを読み、長いテキストには重なり合う窓をスライドさせ、継ぎ目でスパンを統合します — 30ページのファイルも1つの文書として処理。サービング層は会話入力向けの自動セグメンテーションを追加:短文は一括デコード、長文は文単位の走査も行い、両者が一致して初めてスパンが成立します。
書簡4倍の長さでもスコアは維持:EN 96.6、DE 93.8 — 品質の崖はありません。上記の判例テスト(TAB、1文書約5,000字)はまさにこの経路で実行。公平性:512トークン制限の他社モデルにも長文書では同じ窓処理を適用 — 表が測るのはモデルの実力であり、切り詰めの既定値ではありません。
ツールは実測値で選ぶべきだからこそ、自社の弱点も公開します。以下はすべて1.4計画に組み込み済みで、最初の項目は訓練中です。
| 領域 | 現在の実測値 | 状況 |
|---|---|---|
| 超長文レコード(REDACTテスト) | 36.5 対 Azure 51.2 | 長文レコード専用の訓練コーパスを1.4キャンペーンに組み込み済み。 |
| 合成の米国書式レジスタ(Gretel、Nemotron) | 寛容 52.2 / 64.4 対 Liquid AI 84.5 / 87.3 | 書式文書レジスタの訓練トラックを1.4で計画。 |
| 判例文書のスパン慣習(TAB) | 検出は寛容78.3、厳密スパンは34.4 | エンティティは検出できています。スパン境界の慣習(敬称、機関の正式名称)が異なるだけです。サービング側の慣習プロファイルを作成中 — 再訓練は不要。 |
| チャット攻撃プロンプト | 84.9 対 Azureプレビュー 88.8 | PresidioとGLiNER2はすでに上回っています。会話テキスト向けデコーダの改良を1.4で継続。 |
| 15言語中8言語の百科事典レジスタ | 1.3で7言語は改善、残る8言語は百科事典テキストで後退 | ビジネス文書の品質は影響なし。両立の再調整が1.4訓練の主目標 — 実行中です。 |
公開モデル innovius/shinrai-pii-m-v1.3(フル精度、ONNX Runtime)で 1 リクエストの PII 検出にかかる時間。4 つのテキストサイズ:チャットの一言(62 トークン ≈ 45 語)、段落(317 トークン ≈ 230 語、ShinrAI のレイテンシ値の基準)、1 ページ(1,024 トークン、モデルのウィンドウ)、長文書(10,000 トークン ≈ 15 ページ)。無印はその機器で実測、≈ はモデルの計算量からの推定(±40 %)、~ は実測した同系機からの換算。
| 機器 | RAM / VRAM | チャットの一言 | 段落 | 1 ページ | 長文書 | 向いている用途 |
|---|---|---|---|---|---|---|
| シングルボードコンピュータ | ||||||
| Raspberry Pi 4 Model B (4 GB) | 4 GB · 不足 | ≈706 ms | ≈3.7 s | ≈12.5 s | ≈2.6 min | 文書・データ処理のみ — チャットには遅すぎる |
| Raspberry Pi 4 Model B (8 GB) | 8 GB · 十分 | ≈706 ms | ≈3.7 s | ≈12.5 s | ≈2.6 min | 文書・データ処理のみ — チャットには遅すぎる |
| Raspberry Pi 5 (8 GB) | 8 GB · 十分 | ≈193 ms | ≈982 ms | ≈3.3 s | ≈40.4 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Raspberry Pi 5 (16 GB) | 16 GB · 十分 | ≈193 ms | ≈982 ms | ≈3.3 s | ≈40.4 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| ミニ PC | ||||||
| Intel N100 mini PC (16 GB) | 16 GB · 十分 | ≈174 ms | ≈835 ms | ≈2.8 s | ≈33.9 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| ノート PC | ||||||
| Apple M1 (MacBook Air class, 4P+4E) | 8 GB · 十分 | ~87 ms | ~458 ms | ~1.8 s | ≈16.9 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Apple M4 (MacBook Air / iMac / Mac mini, 4P+6E) | 16 GB · 十分 | ~16 ms | ~78 ms | ~310 ms | ~4.0 s | リアルタイム:AI チャット・アシスタント向き |
| x86 laptop, 8 cores (Ryzen 7 7840U / Core Ultra 7 class) | 16 GB · 十分 | ~48 ms | ~189 ms | ~676 ms | ~6.8 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| デスクトップ・ワークステーション | ||||||
| Apple M4 Pro (Mac mini 2024, 10P+4E) | 64 GB · 十分 | 13 ms | 56 ms | 233 ms | 3.1 s | リアルタイム:AI チャット・アシスタント向き |
| AMD Threadripper 7960X workstation (24 cores, CPU only) | 64 GB · 十分 | ≈21 ms | ≈64 ms | ≈193 ms | ≈2.3 s | リアルタイム:AI チャット・アシスタント向き |
| エッジ GPU(Jetson) | ||||||
| NVIDIA Jetson Orin Nano Super (8 GB) | 8 GB · 十分 | ≈24 ms | ≈106 ms | ≈344 ms | ≈4.2 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| NVIDIA Jetson Orin NX (16 GB) | 16 GB · 十分 | ≈26 ms | ≈116 ms | ≈380 ms | ≈4.6 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| NVIDIA Jetson AGX Orin (64 GB) | 64 GB · 十分 | ≈13 ms | ≈45 ms | ≈140 ms | ≈1.7 s | リアルタイム:AI チャット・アシスタント向き |
| デスクトップ/ワークステーション GPU | ||||||
| NVIDIA DGX Spark (GB10) | 128 GB · 十分 | ≈6 ms | ≈9 ms | ≈19 ms | ≈175 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA RTX 3090 (24 GB) | 24 GB · 十分 | ≈6 ms | ≈9 ms | ≈17 ms | ≈151 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA RTX 4090 (24 GB) | 24 GB · 十分 | ≈6 ms | ≈8 ms | ≈16 ms | ≈131 ms | リアルタイム:AI チャット・アシスタント向き |
| サーバー・クラウド VM — CPU のみ | ||||||
| AMD EPYC 7002 'Rome' VM, 2 vCPU (cgroup limit) | 6 GB · 十分 | 131 ms | 589 ms | 2.2 s | 29.8 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| AMD EPYC 7002 'Rome' VM, 4 vCPU | 6 GB · 十分 | 83 ms | 350 ms | 1.2 s | 15.5 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| AMD EPYC 7002 'Rome' VM, 8 vCPU | 6 GB · 十分 | 59 ms | 237 ms | 845 ms | 8.5 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| AMD EPYC 7002 'Rome' VM, 16 vCPU | 6 GB · 十分 | 76 ms | 215 ms | 668 ms | 7.2 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Cloud VM, 4 vCPU x86 (AMD EPYC 9V74 "Genoa", shared, GitHub-hosted runner) | 16 GB · 十分 | 105 ms | 514 ms | 1.9 s | ≈21.0 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Cloud VM, 4 vCPU Arm (Neoverse N2 / Cobalt 100, GitHub-hosted runner) | 16 GB · 十分 | 92 ms | 442 ms | 1.7 s | ≈18.0 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Cloud VM, 4 vCPU Intel Ice Lake / Sapphire Rapids (AVX-512 VNNI) | 16 GB · 十分 | ~70 ms | ~298 ms | ~1.0 s | ~13.1 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| Hugging Face Space, cpu-upgrade (8 vCPU, 32 GB) | 32 GB · 十分 | ~83 ms | ~350 ms | ~1.2 s | ~15.5 s | エージェント型 AI・ワークフロー向き(リアルタイムチャットは不向き) |
| サーバー — GPU | ||||||
| NVIDIA Tesla P40 (24 GB, Pascal 2016) | 24 GB · 十分 | 9 ms | 25 ms | 93 ms | 1.6 s | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA T4 (16 GB) | 16 GB · 十分 | ≈10 ms | ≈31 ms | ≈93 ms | ≈1.1 s | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA L4 (24 GB) | 24 GB · 十分 | ≈6 ms | ≈10 ms | ≈19 ms | ≈178 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA A10 (24 GB) | 24 GB · 十分 | ≈6 ms | ≈9 ms | ≈19 ms | ≈171 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA L40S (48 GB) | 48 GB · 十分 | ≈6 ms | ≈7 ms | ≈10 ms | ≈62 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA A100 (80 GB) | 80 GB · 十分 | ≈6 ms | ≈7 ms | ≈11 ms | ≈72 ms | リアルタイム:AI チャット・アシスタント向き |
| NVIDIA H100 SXM (80 GB) | 80 GB · 十分 | ≈5 ms | ≈6 ms | ≈7 ms | ≈26 ms | リアルタイム:AI チャット・アシスタント向き |
Raspberry Pi:文書・データパイプラインには使えます(段落 1 つが Pi 5 で約 1 秒、Pi 4 で約 4 秒)が、チャットには不向きです。コンパクトなモデルファイル配置で RAM 4 GB 以上、8 GB あれば余裕、64-bit OS。
メモリ:フル精度のモデルセッション 1 つに、配布形式で約 2.0 GB、ONNX external-data 配置なら約 0.9 GB の RAM が必要です(速度は同じ)。小型機器にはこの配置を推奨します。
ShinrAI サービス経由では、既定の長文モードが 1,200 文字を超えるテキストを文単位でも読み直します(再現率向上のため)。段落では約 3 倍のコストになります。下の行は同じ GPU での両モードです。
| Tesla P40(2016 年)上の ShinrAI サービス | チャットの一言 | 段落 | 手紙(2 ページ) | 長文書 |
|---|---|---|---|---|
| モデルのみ(全文を 1 パス) | 9 ms | 25 ms | 175 ms | 1.6 s |
| 既定:長文モード(文単位) | 9 ms | 69 ms | 348 ms | 4.9 s |
2026-09-02 に research/hardware-map/hardware-map.json から生成(scripts/hardware/render-map.py)。
| クラス | ShinrAI 1.3 | Azure PII | GLiNER2 | Presidio | OpenAI PF |
|---|---|---|---|---|---|
| PERSON 一般的 / 珍しい / 希少(名前順位) | ネイティブヘッド | Person | zero-shot | PERSON (spaCy) | private persons only |
| CITY 大 / 中 / 小(人口) | ネイティブヘッド | City/Location (preview) | zero-shot | LOCATION (spaCy) | — |
| STREET 一般 / 特定 / 局地 | ネイティブヘッド | Address | zero-shot | — | private address |
| ORG 国際 / 全国 / 地域(サイトリンク) | ネイティブヘッド | Organization | zero-shot (P 15–33%) | ORGANIZATION (off by default) | — |
| EMAIL 標準 | ネイティブヘッド | zero-shot | EMAIL_ADDRESS | private email | |
| USERNAME 標準 | ネイティブヘッド | — | zero-shot | — | — |
| URL 標準 | ネイティブヘッド | URL | zero-shot | URL | private url |
| PHONE 標準 | ネイティブヘッド | PhoneNumber | zero-shot | PHONE_NUMBER | private phone |
| ACCOUNT 標準 | ネイティブヘッド | IBAN / BankAccount | zero-shot | IBAN_CODE, US_BANK_NUMBER | — |
| WALLET 標準 | ネイティブヘッド | — | zero-shot | CRYPTO | — |
| CARD 標準 | ネイティブヘッド | CreditCardNumber | zero-shot | CREDIT_CARD | — |
| NATIONAL_ID 標準 | ネイティブヘッド | ~70 country ID categories | zero-shot | ~76 country recognizers | — |
| PLATE 標準 | ネイティブヘッド | LicensePlate (preview) | zero-shot | — | — |
| DOB 標準 | ネイティブヘッド | DateOfBirth (preview) | zero-shot | DATE_TIME (any date) | — |
| NETADDR 標準 | ネイティブヘッド | IPAddress | zero-shot | IP_ADDRESS | — |
| POSTAL_CODE 標準 | ネイティブヘッド | ZipCode (preview) | zero-shot | — | — |
| CUSTOMER_ID 標準 | ネイティブヘッド | — | zero-shot | — | — |
| SECRET 標準 | ネイティブヘッド | Password (preview) | zero-shot | — | — |
| CODENAME 標準 | ネイティブヘッド | — | zero-shot (43% recall on the 27 prompts; 7 languages) | — | — |
| F1スコア | 「すべて見つけた」(再現率)と「誤警報なし」(適合率)を1つにまとめた0〜100の数値。高いほど良い。 |
| 厳密 | 文字境界が完全一致し、タイプも正しい場合のみ検出成立。 |
| 寛容 / 部分一致 | 正しいテキストに正しいタイプで触れれば検出成立。スパン慣習が異なるシステム間でより公平。 |
| テストセット × 言語 | 表の各行は1言語の公開テストセット1件、通常300テキスト。 |
| 最良しきい値 | 他社は感度設定を走査した最良値を報告。ShinrAIは常に標準設定の値を報告。 |
| ⚠ このテストセットで訓練済み | そのシステムは訓練中にこのテストのデータを見ています — 当該スコアは水増しされており比較になりません。 |
| 適合率 / 再現率 | 適合率:検出したもののうち正しかった割合。再現率:存在するもののうち見つけた割合。 |
| ベータロケール | ヘブライ語は統合とフィードバックのために提供中。品質はリリース水準未満ですが、常に表示し、集計にも含めます。 |
ShinrAI(信頼)· Innovius × EECC Research Labs · ユーリッヒ・スーパーコンピューティングセンター(JURECA、WestAI)で訓練 · 公開モデル重み · ShinrAIを今すぐ試す — PIIプレイグラウンド