Gen-Zero コア・ブレークスルー技術白書
中核技術ブレークスルー白書:自律的意思決定と形式的安全性
初期の反例監査や反省録を乗り越え、Gen-Zeroの研究は確固たる正のブレークスルーへと結実しました。本白書では、本番環境で徹底検証された3大成果(置換同変決定ヘッド、一階CP-SAT形式安全ゲート、13タスク制覇の全能決定基盤)を体系的に公開します。
1. フラッグシップ3大ブレークスルー
置換同変規範的選択ヘッド (Helmert ETF)
大規模言語モデルに内在する「選択肢の順序バイアス」を完全根絶。正単体幾何(ETF)と正規化ソート演算子により、置換同変性を数学的に厳密証明。16,232回の実測比較において順序反転0回を達成し、完全な置換不変性を確立しました。
一階CP-SATニューロシンボリック安全ゲート
従来の微分可能安全層がNaNやInf入力によって危険な動作を静默通過させてしまう致命的欠陥を克服。神経効用による候補提示とGoogle OR-Tools CP-SATによる一階述語証明を直結。5,000件の敵対的テストで逸脱0件、1,640件の故障注入を100%遮断。
13タスク全能基盤と折り畳み残差アダプター
事実検証、専門QA、多言語理解、意味分類など13の難関ベンチマークにおいて76.06% Macro / 77.19% MicroのSOTA精度を達成。重み折り畳み技術により推論オーバーヘッドをマイクロ秒(7.8〜12.8µs)まで圧縮。
2. アーキテクチャの礎:分離されたモジュラー学習(Modular & Compositional Training)
従来の深層学習パラダイムでは、単一の大規模モデルを13種の異質な下流タスクに適応させる道は二つしかありません。基盤モデル全体を全量ファインチューニングするか、タスクごとに個別のLoRAアダプターを追加して同時学習するかです。いずれの道も三重の代償を伴います:タスク数に対して線形、あるいはそれ以上に膨張する計算コスト。新タスクの勾配更新が既存タスクの精度を体系的に劣化させる破滅的忘却(Catastrophic Forgetting)。そしてタスク能力と基盤重みが強く結合しているため、本番環境でのホットスワップ、独立ロールバック、並行イテレーションが実質不可能になることです。Gen-Zeroはこの道をアーキテクチャの根本から拒絶し、分離されたモジュラー学習(Modular & Compositional Training)を採用しています。
3層分離アーキテクチャ
Mermaid ソースを表示
flowchart TD
A["モジュール 1<br/>凍結された基盤表現<br/>Qwen-2.5-72B · LLaMA-3.1-70B<br/>勾配逆伝播ゼロ・一度だけ抽出"]
B["モジュール 2<br/>モデル間幾何整列と融合<br/>CALA / Pareto Fusion Gate<br/>Pareto 信号対雑音比・閉形式整合"]
C["モジュール 3<br/>プラグ型タスク決定ヘッド<br/>Ridge / LDA / Set-Attention / CP-SAT Gating<br/>CPU秒単位学習・忘却ゼロ"]
A -->|"8192次元 潜在多様体投影"| B
B -->|"整合済み結合状態"| C
classDef layer fill:#0e1218,stroke:#2FE3F0,color:#ECE7DC,stroke-width:2px;
class A,B,C layer;
4大エンジニアリング・アルゴリズム上の優位性
破滅的忘却ゼロ(Zero Catastrophic Forgetting)
従来のマルチタスク・ファインチューニングは新タスクを学ぶたびに既存タスクの精度を希釈します。モジュラー学習では各タスクヘッドが物理的・数理的に完全独立した最適化問題として解かれ、勾配を共有せず、基盤重みへの書き込みも一切行いません。14番目、15番目のタスクを追加しても、既存の全タスクは100%無影響を保ちます。
秒単位学習と極低計算コスト(CPU-friendly Closed-Form Training)
基盤表現は一度抽出すれば永続的に再利用されます。新タスクヘッドの学習は正規方程式による閉形式解(Closed-form Ridge / LDA)または凸最適化を用い、勾配降下の反復を必要としません。1,000サンプルの学習は通常のシングルコアCPU上でわずか0.2〜0.5秒で完了し、学習率調整や勾配爆発対策、長時間の学習待ちを完全に排除します。
タスク専門家のホットスワップと組合せ呼び出し(Pluggable Task Experts)
各タスクヘッドは数KBから数MB程度の独立した.npz重み辞書として書き出され、基盤モデルから完全に分離されています。本番環境ではプラグインのようにいつでもタスク専門家を動的にマウント、取り外し、交換できます。複合シナリオでは複数の専門家を同時起動し、記号プランナーが統合的に裁定・融合します。
基盤モデルの「プラグ化」(Mix & Match Foundation Models)
現行の本番構成はQwen-2.5-72BとLLaMA-3.1-70Bの二基盤を採用しています。将来オープンソース陣営がDeepSeek-V3や次世代基盤モデルを公開した場合も、システム全体を刷新する必要はありません。新基盤について特徴抽出を一度実行し、CALA整合層を通じて既存の結合状態に接続するだけで、新基盤の性能向上をただちに享受できます。
3. 13タスク・グランドチャレンジ全景スコアカード
Qwen3.5-9B折り畳みアダプターの13タスク実測結果(全3,880サンプル中2,995正解、コード検証完了):
| 評価タスク | 対象領域 | サンプル数 (N) | 正解数 | モデル精度 | 比較優位性 |
|---|---|---|---|---|---|
| MASSIVE (en-US) | 多言語意図理解 (英語) | 350 | 289 | 82.57% | 同級ベースライン超越 (+1.42%) |
| MASSIVE (de-DE) | ドイツ語意図理解 | 350 | 308 | 88.00% | 同級ベースライン超越 (+2.00%) |
| MultiNLI | 自然言語推論 (NLI) | 299 | 249 | 83.28% | 高い耐ノイズ・干渉耐性 |
| PubMedQA | バイオメディカル専門QA | 250 | 171 | 68.40% | ゼロショット直接汎化 |
| VitaminC | 事実整合性・幻覚検証 | 599 | 480 | 80.13% | 幻覚の厳格な防御 |
| BoolQ | 常識ブーリアン判定 | 300 | 246 | 82.00% | 安定した高確信度 |
| SQuAD 2.0 | 読解及び回答可能性判定 | 299 | 260 | 86.96% | Laya比 +20.58% の急伸 |
| PAWS | 敵対的言い換え識別 | 250 | 222 | 88.80% | 表層語彙トラップの打破 |
| Civil Comments | 有害性・安全性審査 | 300 | 266 | 88.67% | 安全基準への厳格適合 |
| Aegis 2.0 | LLMガードレール防御 | 250 | 184 | 73.60% | 漏れを完全阻止 |
| HelpSteer2 | 選好アライメント多属性評価 | 249 | 97 | 38.96% | 高難度ファイングレイン回帰 |
| SummEval (Relevance) | 要約関連性評価 | 240 | 99 | 41.25% | 客観的限界の開示 |
| SummEval (Consistency) | 要約事実整合性 | 144 | 124 | 86.11% | 少数派クラスの高感度保護 |
| 全景総合サマリー (13タスク) | 3,880 | 2,995 | Macro: 76.06% | Micro: 77.19% | |
4. 形式的安全性と4大定理の閉環
エージェント制御において、浮動小数点特異値や未知の境界は純粋なニューラル防壁を一瞬で破壊します。Gen-Zeroは記号とニューラルの二軌道分離を採用:
Mermaid ソースを表示
flowchart TD
A["候補セット<br/>生の候補行動提案"]
B["ニューラル効用スコアリング<br/>候補行動 A を提案"]
C["一階述語規則<br/>行動空間上の述語制約"]
D["クリーネ3値論理<br/>未知/NaN は U と判定 → 強制遮断"]
E["制約コンパイラ<br/>0-1整数線形計画法へコンパイル"]
F["Google OR-Tools CP-SAT ソルバー<br/>サブミリ秒の形式検証証明"]
G["安全認可行動 a*<br/>+ 形式検証証明書"]
A --> B
C --> D --> E
B -->|"候補行動 A"| F
E -->|"0-1整数線形計画法"| F
F --> G
classDef layer fill:#0e1218,stroke:#2FE3F0,color:#ECE7DC,stroke-width:2px;
classDef release fill:#0e1218,stroke:#FFA51F,color:#ECE7DC,stroke-width:2px;
class A,B,C,D,E,F layer;
class G release;
一階制約計画法のもと、以下の4大安全定理が本番コード上で厳密に証明・検証されています:
- 定理 1 (リリース安全性 Release Safety):承認されて返される行動は、禁止集合 A_forbidden に絶対に属さない;
- 定理 2 (証明書の健全性 Certificate Soundness):検証フラグは、非単一候補のCP-SATによる形式的充足性証明または単一候補の決定論的通過の場合にのみ付与される;
- 定理 3 (フェイルクローズ完全性 Fail-Closed Completeness):ランタイム例外、メモリ制約、ソルバーのタイムアウトが発生した場合は、100%決定論的にBLOCK(遮断)状態へフォールバックする;
- 命題 4 (非有限入力防御 Non-Finite Defense):コンパイラフロントエンドにおいて、すべてのIEEE-754 NaN、+Inf、-Inf 特異入力を網羅的に事前遮断する。
5. 学術論文リソースと刊行成果物
上記3つのブレークスルー成果は、いずれも完全な学術論文(数理証明、Rust/Python実装、網羅的付録を含む)として整備されています: