【実証データ】Gemma 3 4B × KAI Patent Layer ハルシネーション制御ベンチマーク

【実証データ】

Gemma 3 4B × KAI Patent Layer ハルシネーション制御ベンチマーク

【技術レポート公開】

標準的な学術ベンチマーク「HaluEval(QAタスク 100件)」を用い、ローカルモデル「Gemma 3 4B」に KAI Patent Layer(特許第7867310号)をドッキングさせた精度検証を実施いたしました。

小型モデル特有の判定不全(正解率50.0%のランダム判定状態)を解消し、識別・制御レイヤーとしての極めて高い有効性を実証しています。

📌 ベンチマーク検証結果(計100件テスト)

  • ハルシネーション検出率(Recall): 82.0%嘘や矛盾を含む回答の 8割以上(82.0%) を高確率でキャッチ。
  • 適合率(Precision): 73.2%「過剰検知(正常な回答をハルシネーションと見なす誤判定)」を極限まで抑制。
  • 正解率(Accuracy): 76.0%識別不能状態(コイントス同等の 50.0%)から +26.0% という大幅な精度向上を達成。

🔍 検証のポイントと結論

  • 「ランダム判定」から「高精度な識別機」への劇的な進化単体では正解とハルシネーションの識別が困難であった軽量モデル(4Bクラス)に対し、KAI Patent Layer を1枚挟むことで、極めて高い精度で正常・異常を自動識別・フィルタリングできる制御構造を構築しました。
  • ローカル運用によるコスト・制限の完全回避高額なクラウドAPIや利用制限(Rate Limit / 429エラー)に縛られることなく、完全オンプレミス・ローカル環境の小型オープンモデルでも、実用レベルを大きく超えるハルシネーション制御運用が可能であることを立証しています。

💻 検証コード・GitHubリポジトリ

[GitHubで検証コードとREADMEを見る(candataoyabin-max/kai-gemma-halueval-benchmark)]

📊 評価指標一覧

評価指標Gemma 3 4B 単体(基準値)Gemma 3 4B × KAI Patent Layer(最適判定)比較・改善効果
Accuracy (正解率)50.00%76.00%+26.0% 向上
(高精度な識別能力を獲得)
Precision (適合率)50.00%73.21%+23.2% 向上
(正常回答への誤判定を強力に抑制)
Recall (検出率)50.00%82.00%+32.0% 向上
(ハルシネーションの過半を確実に捕捉)
F1-Score (総合判定)50.00%77.36%+27.4% 向上
(極めて高い総合識別バランス)

🚀 今後の拡張性と大型モデル(Gemini / ChatGPT等)への適用について

今回の実証実験では、軽量かつオンプレミスで動作するローカルLLM(Gemma 3 4B)を採用し、KAI Patent Layerによるハルシネーション制御の確実性を検証いたしました。

小型モデルにおいて「正解率76.0% / 検出率82.0%(F1-Score 77.4%)」という圧倒的な精度改善を実証できたことは、本特許技術の位相解析制御能力の高さを示すものです。

【Gemini / OpenAI等のフラッグシップモデルとの連携】

Gemini 1.5/2.0 Pro や GPT-4o といった最新の超大型言語モデルと KAI Patent Layer をドッキングさせることで、高次元な推論能力と厳格なハルシネーション自動防衛が融合し、金融・医療・法務・インフラなど「誤回答が絶対に許されない領域」でも耐えうる極限の信頼性を実現可能です。

「自社で利用中のLLM(クラウドAPI / ローカルモデル)にKAIを組み込みたい」「PoCで検証したい」という企業様は、ぜひお気軽にお問い合わせください。。

← トップページ(KAI Patent Layer)に戻る