【実証データ】
Gemma 3 4B × KAI Patent Layer ハルシネーション制御ベンチマーク
【技術レポート公開】
標準的な学術ベンチマーク「HaluEval(QAタスク 100件)」を用い、ローカルモデル「Gemma 3 4B」に KAI Patent Layer(特許第7867310号)をドッキングさせた精度検証を実施いたしました。
小型モデル特有の判定不全(正解率50.0%のランダム判定状態)を解消し、識別・制御レイヤーとしての極めて高い有効性を実証しています。
📌 ベンチマーク検証結果(計100件テスト)
- ハルシネーション検出率(Recall): 82.0%嘘や矛盾を含む回答の 8割以上(82.0%) を高確率でキャッチ。
- 適合率(Precision): 73.2%「過剰検知(正常な回答をハルシネーションと見なす誤判定)」を極限まで抑制。
- 正解率(Accuracy): 76.0%識別不能状態(コイントス同等の 50.0%)から +26.0% という大幅な精度向上を達成。
🔍 検証のポイントと結論
- 「ランダム判定」から「高精度な識別機」への劇的な進化単体では正解とハルシネーションの識別が困難であった軽量モデル(4Bクラス)に対し、KAI Patent Layer を1枚挟むことで、極めて高い精度で正常・異常を自動識別・フィルタリングできる制御構造を構築しました。
- ローカル運用によるコスト・制限の完全回避高額なクラウドAPIや利用制限(Rate Limit / 429エラー)に縛られることなく、完全オンプレミス・ローカル環境の小型オープンモデルでも、実用レベルを大きく超えるハルシネーション制御運用が可能であることを立証しています。
💻 検証コード・GitHubリポジトリ
[GitHubで検証コードとREADMEを見る(candataoyabin-max/kai-gemma-halueval-benchmark)]
📊 評価指標一覧
| 評価指標 | Gemma 3 4B 単体(基準値) | Gemma 3 4B × KAI Patent Layer(最適判定) | 比較・改善効果 |
| Accuracy (正解率) | 50.00% | 76.00% | +26.0% 向上 (高精度な識別能力を獲得) |
| Precision (適合率) | 50.00% | 73.21% | +23.2% 向上 (正常回答への誤判定を強力に抑制) |
| Recall (検出率) | 50.00% | 82.00% | +32.0% 向上 (ハルシネーションの過半を確実に捕捉) |
| F1-Score (総合判定) | 50.00% | 77.36% | +27.4% 向上 (極めて高い総合識別バランス) |
🚀 今後の拡張性と大型モデル(Gemini / ChatGPT等)への適用について
今回の実証実験では、軽量かつオンプレミスで動作するローカルLLM(Gemma 3 4B)を採用し、KAI Patent Layerによるハルシネーション制御の確実性を検証いたしました。
小型モデルにおいて「正解率76.0% / 検出率82.0%(F1-Score 77.4%)」という圧倒的な精度改善を実証できたことは、本特許技術の位相解析制御能力の高さを示すものです。
【Gemini / OpenAI等のフラッグシップモデルとの連携】
Gemini 1.5/2.0 Pro や GPT-4o といった最新の超大型言語モデルと KAI Patent Layer をドッキングさせることで、高次元な推論能力と厳格なハルシネーション自動防衛が融合し、金融・医療・法務・インフラなど「誤回答が絶対に許されない領域」でも耐えうる極限の信頼性を実現可能です。
「自社で利用中のLLM(クラウドAPI / ローカルモデル)にKAIを組み込みたい」「PoCで検証したい」という企業様は、ぜひお気軽にお問い合わせください。。