OPEN MODEL Japanese PII token classification

大切な個人情報が
流出する前に。

氏名、住所、電話番号、メールアドレスなどを検出する日本語NERモデル。ONNX Runtime Webを使い、テキストをサーバーへ送信せずに試せます。

MODEL / 001PUBLIC
ssl-jp/
pii-ja-ner-onnx
FORMAT
ONNX · INT8
SIZE
105.4 MiB
LABELS
37 BIO
LICENSE
Apache-2.0
ON-DEVICE INFERENCEText stays in your browser

文章を入れて、
結果を確かめる。

49 chars
EXAMPLES
FIRST RUN DOWNLOAD解析の前にモデルを読み込みます
105.4 MiB

入力テキストはブラウザの外へ送信されません

OUTPUT / DETECTED ENTITIES
READY FOR INPUT

検出箇所・ラベル・信頼度を表示します。

Tokenizer noteこのブラウザデモでは Intl.Segmenter + WordPiece を使用します。学習時のMeCabと分割が異なるため、正式な精度評価ではPython版トークナイザーをご利用ください。

PII検出を、
自社の環境内で。

日本語テキストから個人を特定しうる情報をトークン単位で抽出するBERTベースのNERモデルです。量子化済みONNXを配布しているため、サーバーだけでなくブラウザやモバイル、エッジ環境にも組み込めます。

Hugging Faceで詳細を見る
01

18種類のPII

氏名、組織名、住所、連絡先、各種IDなどをBIO形式の37ラベルで識別します。

02

エッジで実行

ONNX Runtime WebのWasmとWebGPUに対応。入力を外部APIへ渡さない構成を選べます。

03

INT8量子化

配布モデルは約105.4 MiB。ブラウザで扱えるサイズと推論性能のバランスを取っています。

04

Apache-2.0

検証からシステム実装まで進めやすい、オープンなモデルとして公開しています。

検出できる情報

01氏名PERSON_NAME
02組織名ORGANIZATION_NAME
03電話番号PHONE_NUMBER
04メールEMAIL
05住所ADDRESS
06マイナンバーMY_NUMBER
07旅券番号PASSPORT_NUMBER
08免許証番号DRIVER_LICENSE
09保険番号INSURANCE_NUMBER
10社員番号EMPLOYEE_ID
11学籍番号STUDENT_ID
12銀行口座BANK_ACCOUNT
13カード番号CREDIT_CARD
14生年月日DATE_OF_BIRTH
15年齢AGE
16IPアドレスIP_ADDRESS
17URLURL
18ユーザー名USERNAME

実装までの、
シンプルな流れ。

  1. 01
    モデルを取得

    Hugging Faceから量子化ONNXと語彙を読み込みます。ラベル定義はconfig.jsonに対応するスナップショットを使用します。

  2. 02
    入力をトークナイズ

    学習時と同じBertJapaneseTokenizerを使い、input_idsとattention_maskを生成します。

  3. 03
    ORTで推論

    サーバーならONNX Runtime、Webならonnxruntime-webでセッションを作成して実行します。

  4. 04
    BIOラベルを統合

    トークンごとのB/Iラベルを文字列の範囲へ戻し、マスキングやレビュー画面へ連携します。

app/lib/ort.ts
// model runs locally in the browser
const session = await ort.InferenceSession.create(
  modelBytes,
  { executionProviders: ["wasm"] },
);

const output = await session.run({
  input_ids,
  attention_mask,
});

MODEL INTEGRATION / CONSULTING

オープンモデルから実運用へ。

精度検証やチューニング、モデル組み込み、システム開発のご相談はこちらから。

お問い合わせ(白金数理合同会社)