1 ポイント 投稿者 jsb4702 8 시간 전 | まだコメントはありません。 | WhatsAppで共有

図面・BOM・発注にまで、捏造された部品番号や一見気づきにくい誤計算が紛れ込む業界で
働いているうちに、LLM の回答を「検査合格前は出荷禁止」の文書のように扱うハーネスを
作り、ここ数か月実運用している。個人・ドメイン情報を取り除いたキュレーション済みスナップショットを公開する。

  • 回答送出前の検証ゲート 13 種:捏造防止(部品番号・DOI の推測生成を禁止)、
    算術の Bash 再実行、プロンプトインジェクションの隔離、「実行した」と主張する場合の実際のツール出力との
    照合、失敗事例を回帰ゴールドセットとして固定化する再発防止ゲートなど
  • すべての重要な数値・引用・因果関係の主張に信頼度 3 段階を付与 — 記憶ベースの引用は
    最大でも黄、緑は実際に調査したもののみ
  • 安全しきい値に関わる結論は異種モデル(Gemini・Groq・OpenAI CLI)で並列再導出し、収束を
    判定 — 同一モデルのセルフチェックは同じ盲点を共有するという前提
  • 外部スキル/プラグインは、隔離→静的スキャン→人手で精読→リビルドの後にのみ取り込む
    サプライチェーン INTAKE パイプライン(自然言語の指示文もコード同等の脅威として扱う)
  • 新しいチェッカーはシャドーモードで誤検知率を測定してから昇格し、検証済みの主張は台帳に格納して
    矛盾を自動照合

ゲートフックとチェッカーは実際に動作する Python コードで、回帰テストも同梱されている。
クローンして追加の依存関係なしにすぐ実行できる:
python3 eval/tests/test_g9_regression.py --hook hooks/g9_arith_enforce.py
python3 hooks/tests/test_glossary_hook.py
settings.example.json でフックを配線すれば、自分の環境でもゲートが動作する。
丸ごと配布するディストリビューションではなく、フック・チェッカー単位で選んで組み込む構造。
ドキュメントの多くは日本語ではなく原文言語だが、アーキテクチャと README は英語。

まだコメントはありません。

まだコメントはありません。