一語も発せず、
それでも決める。
AI は推論過程を書き出さずに「はい」か「いいえ」と答えられるだろうか。トークン生成ゼロ意思決定は、より短い経路を約束する。難しいのは、その経路が本当に機能する条件を見極めることである。
トークン税を探る入力にも決定ヘッドにもコストがかかる。
説明文を先に生成させるのではなく、モデルがすでに持つ表現から意思決定を直接読み出す。
収縮的な潜在状態更新:検証可能な経路
反復する隠れ状態更新は、推論トークンを生成せずに入力長に応じた計算深度を加えうる。これは形式的な設計であり、現在の本番経路で更新器が学習・実行された証拠ではない。
導出と証拠の限界を開く
Banach の収束には条件がある。U は完備距離空間の自己写像であり、Lipschitz 定数 γ < 1 を満たす必要がある。LayerNorm と学習ゲートだけではこの境界は保証されない。条件が成り立つとき、連続する更新の距離は幾何級数的に減少する。
定理 3 · 条件付き表現力
更新全体が R = n 回の依存するステップを実行し、必要な長さ依存の合成を実現できるなら、深度は一様な定数ではない。この場合、単一パスのデコーダに対する固定深度 TC⁰ 境界は適用できない。それだけで NC¹ との分離、モデルの実装、ベンチマークでの優位性は証明されない。
CLUTRR · 10 ホップ関係合成
S2 · 双方向の中間合流
64.75%35.25% refusalS3 · CYK 経路格子 / チャート畳み込み
99.18%121/121 correct · 0 errors · 0.82% refusal過去の Gen-2 参照値。テストは 122 件で、正解率の分母には拒否を含む。S3 は回答した 121 件すべて正解、誤答 0 件、構造的曖昧さにより 1 件拒否(0.82%)。元の再実行ログはこのチェックアウトにないと README に記載される。記録された全ホップのテストバイナリは 1.05 秒であり、全スイートが 1 秒未満という主張は確認できない。
MultiNLI · 潜在状態の反復
90.30% はサイトの別箇所に掲載された単一パス線形プローブの比較値。確認した資料には、対応する MultiNLI 更新器の実行結果やステップごとの残差記録がない。γ ≈ 0.42、5–8 ステップ、‖Δₜ‖ < 10⁻⁴ は検証目標であり、測定済みの収束値ではない。
証拠の範囲:研究リポジトリ README(過去の CLUTRR 表、再実行ログなし)、サイトの smoke-preview スコアカード(90.30% プローブ)。どちらも対応する更新器の証拠ではない。
「はい」と言うためだけに、
なぜ作文が必要なのか。
二値の答えが運ぶ情報は最大 1 ビットである。それでも推論モデルは、決定を下す前に数百トークンを生成することがある。これらのトークンは計算上の請求書であり、ときに有用な作業領域でもある。
自己回帰生成は一連のステップである。トークンを 1 個生成し、伸び続ける文脈に加え、次のトークンを生成する。思考の連鎖(CoT)は中間結果を保持し、後続のステップで利用できるようにする。キャッシュがあっても、新しいトークンごとに復号ステップがもう 1 回必要になる。
ゼロトークンの読み出しは別の経路をとる。入力を処理し、その隠れ状態表現を取り出し、小さな決定ヘッドにラベルを選ばせる。必要な区別がすでに取り出せる形で存在するなら、書き出す必要はないかもしれない。そうでなければ、安価な読み出しが欠けている計算を魔法のように補うことはない。
書いてから決める
二値決定のためにモデルが常に数百トークンを必要とするわけではない。これは検証すべきトレードオフであり、普遍的な要件ではない。
読んでから決める
「ゼロトークン」とは、生成される出力トークンがゼロという意味である。入力トークン、遅延、エネルギーがゼロという意味ではない。単一パスの図は概念図である。CPU の候補選択実装は、プロンプトのキャッシュ状態から候補の続きを実行してから採点する。生成トークンがゼロでも、バックボーン呼び出しが 1 回とは限らない。
トークン税を体感する。
パラメータをドラッグしてほしい。1 回の直接読み出しと、50 個または 300 個の推論トークン生成とを比較する。これは提供コストの透明なトイモデルであり、論文のベンチマークではない。
追加実験:設定可能なドル建てコスト
遅延とコストの実験台
説明用モデル · 入力は同一| 経路 | 遅延 | 計算コスト | スループット(回/分) |
|---|---|---|---|
| 0 トークン | 0.205 s | $0.114 | 292.7 |
| 50 トークン | 1.200 s | $0.667 | 50.0 |
| 300 トークン | 6.200 s | $3.444 | 9.7 |
詳細:式と省略した項目
P を入力処理時間(秒)、H を決定ヘッドの時間、R を復号速度、N を推論トークン数とする。T₀ = P + H、Tₙ = P + N/R。直列スループット = 60/T 回/分。決定 1,000 回あたりのコスト = 1,000 × T × 時間単価 / 3,600。
この比較は、最終回答トークンの生成、ネットワーク遅延、待ち行列、バッチ処理、トークン化、候補の準備、遊休容量を含まない。入力時間とハードウェア価格が等しいことは前提である。API 料金もエネルギーも見積もらない。速い経路が役に立つのは、その決定が十分に正確な場合だけである。
ゼロトークン対 CoT
遅延・コストシミュレータ
説明用モデル · ベンチマーク測定ではない1 回の順伝播でプロンプトを読む。生成では、出力トークンのために順伝播が繰り返される。コントロールを動かし、その繰り返しが遅延と、到着するクエリが要求する重みトラフィックの速度をどう変えるかを確かめてほしい。
チャートを左右にスワイプすると、各バーの末端の値を確認できる。
仮定と数式:シミュレータのパラメータ
20 ms 対 850 ms の比較は、入力 512 トークン、モデル規模 2B における説明用の参照点である。本論文が確立した対応測定ではない。CoT は生成トークン 40 個としてモデル化する。すなわちプリフィル 1 回と復号 40 ステップである。
遅延: プリフィル = 20 × (パラメータ数 / 2B) × (入力トークン / 512) ms、復号 = 40 × 20.75 × (パラメータ数 / 2B) ms。これらの単純な線形則は教育用の仮定であり、ハードウェアの予測器ではない。QPS が変えるのはトラフィック需要であり、単独クエリの遅延ではない。待ち行列は含まない。
重みトラフィック: 1 パラメータ 2 バイト、順伝播 1 回につき重み全体を 1 回読み出し、バッチ処理もキャッシュ再利用もないと仮定する。ゼロトークン = 読み出し 1 回、CoT = 読み出し 41 回。GB/s = クエリあたりの GB × QPS(十進 GB)。プロンプト長はこの重みのみの見積もりを変えない。注意機構、KV キャッシュのトラフィック、活性値、決定ヘッドのオーバーヘッド、デバイスの制約は含まない。ここでの 0.5B 設定は 16 ビット格納を仮定したものであり、後述の PAWS INT8 アーカイブとは異なる。ここでいうコストはトラフィックであり、ドル建ての見積もりではない。各チャートは表示する軸を都度スケールし直す。
ステーション数が
固定された工場。
入力が長くなるほど横に広げられるが、直列の組立ステーションは決して増やさない工場を想像してほしい。これが一定の深さの直観である。
作業者は多く、段数は同じ。
各段の内部では、多数の作業者が並列に働く。TC⁰ では、しきい値ゲートが多数の入力ビットを調べ、「これらのビットの少なくとも半分は 1 か」といった問いを立てられる。多項式サイズという条件が、作業者数の増え方を制限する。
「一様」とは、工場の規模ごとに配線を与える体系的な手順があるという意味である。入力ごとに計算済みの答えをひそかに詰め込んだ、別々の工場ではない。
深さとは依存関係の連鎖である。
固定された Transformer 層のスタックは、この組立ラインを思わせる。トークンをもう 1 個生成するとそのスタックが再利用され、後続の計算が新たに書き込まれた中間結果に依存できるようになる。
Transformer 層は、文字どおり 1 個のしきい値ゲートではない。論文は、パイプライン全体が一定の深さのしきい値回路で模倣でき、精度が有界で、符号化の規模が多項式で抑えられると仮定する。モデルの名前だけでは、この仮定は成り立たない。
追加実験:単一順伝播の層トレース
信号が各層を通過する様子を追う
概念図入力の準備ができた。進めて、情報が四つの模式的な層と決定ヘッドを通過する様子を観察してほしい。
四つの層は模式図であり、評価したいずれのモデルのアーキテクチャでもない。スクラッチパッド表示では、新しいトークンはそのつど文脈に加わる。キャッシュした状態は再利用できる。反復は依存計算を増やすが、正確さを自動的に保証するものではない。
パリティ:うまく収まるコイン投げの問題。
裏向きのコインから始める。1 が来るたびに裏返し、0 のときは何もしない。最後は表だろうか。それは 1 の個数が奇数かどうかだけで決まる。
コインを順番に裏返すこともできる。しかししきい値ゲートは、あり得るすべての計数しきい値を並列に調べ、合計が奇数であることを識別し、一定の段数で結果を統合できる。パリティは一様 TC⁰ に属する。状態依存であること自体が課題を難しくするわけではない。
試してみよう:入力ビットを切り替える
3 回反転 · 奇数 · 表
この小さな例は規則を示している。論文の構成は任意の入力長に適用でき、深さは一定、サイズは多項式である。
安易な近道が尽きるところ
次に、五つの対象を並べ替える命令の列を考える。最終的な並びを決めるには、命令の順序が重要になる。論文が扱うのは 120 通りの状態をもつ特定の置換積タスクであり、あらゆる状態機械ではない。
この限界は条件付きである:非一様クラス TC⁰ と NC¹ が異なると仮定すると、一定の深さでしきい値回路により模倣できるパイプラインは、この指定されたタスクをすべての入力長で正しく解くことはできない。
再帰的な機械は、命令ごとに状態を更新できる。並列木も遷移を合成でき、その深さは系列長に対して対数的に増える。書き出された思考の連鎖は計算を増やす一つの方法だが、唯一の方法ではない。
この定理が述べること、述べないこと
TC⁰ ≠ NC¹ という分離は仮定であり、本論文で証明された結果ではない。結論が対象とするのは、漸近的な問題族と指定された計算上の仮定である。有限のベンチマークが不可能であること、状態依存のタスクがすべて難しいこと、学習済みモデルが構成的な再帰アルゴリズムを獲得することは、いずれも証明しない。個々の算術誤りを説明するものでもない。
回路の
深さエクスプローラ
理論 · 条件付きの境界注意機構は 1 層のうちに系列全体へ届く。この到達は、状態を繰り返し更新することとは別物である。遷移をクリックして経路を確認し、次に再帰計算へ切り替えてほしい。
図を左右にスワイプすると、すべての遷移を確認できる。
三つの層は模式図であり、モデルの仕様ではない。強調表示した経路は情報へのアクセスを示すもので、測定された注意でも、各層が遷移を 1 回しか実行できないことの証明でもない。
数学上の壁はどこにあるか
論文は 5 記号の置換の積(群 S₅、状態は 120 通り)を扱い、その積が固定された非単位の 5-巡回置換に等しいかを問う。非一様 TC⁰ ≠ NC¹を仮定すると、多項式サイズかつ一定の深さで、しきい値回路により模倣できるパイプラインは、この言語をすべての入力長で正しく判定することはできない。
この仮定はパイプライン全体、すなわち符号化、バックボーンの演算、候補の計算、読み出しに及ぶ。すべての Transformer やすべての逐次タスクに対する無条件の不可能性定理ではない。たとえばパリティは TC⁰ に属する。この有限の 8 遷移のデモ自体は容易に解ける。
状態更新の反復は依存計算を増やす。それは生成トークンとして現れることもあれば、トークンを生成せず内部で実行されることもある。均衡のとれた並列合成でも、置換積を O(log n) の深さで解ける。CoT は追加計算の機会を与えるが、推論の正しさを保証しない。
約束が
予測台帳と出会う。
報告された結果は、不均一であるからこそ詳しく見る価値がある。これらは二つの異なるアーカイブ済みシステムであり、サンプル構成が異なり、実行の来歴も未解決である。
視覚残差ストリーム直接読み出し
自己回帰生成の遅延ゼロ
集合注意による候補置換同変読み出し
形式制約による枝刈り
「イエスマン」
という失敗モード。
PAWS は二つの文が同じ意味かどうかを問う。似た語が異なる意味を覆い隠すことがある。「犬が猫を追った」と「猫が犬を追った」は語彙を共有するが、誰が何をしたかが逆である。
上の文対は創作した例であり、アーカイブされたテスト行ではない。
0.5B CPU の台帳では、システムは400 対すべてを言い換えと判定した。予測は単一クラスへ 100% 崩壊している。半分は実際に言い換えであり、半分はそうではない。50% という正解率は、負例を一度も認識しない分類器を覆い隠す。
400 個の答え。
繰り返される一つのラベル。
これは観測された予測の崩壊であり、隠れ状態表現が同一であることも、既知の内部原因があることも証明しない。射影、決定ヘッドの学習、候補への選好、量子化、プロンプトは、いずれも競合する説明として残る。
同じサンプル、まったく異なる二つの像。
各マスは 4 例を表す。見やすさのためにまとめて表示しており、元の行順ではない。
実際のラベル:言い換え 200 件、非言い換え 200 件。
| 実際のクラス | 「はい」と判定 | 「いいえ」と判定 |
|---|---|---|
| 言い換え | 200 | 0 |
| 非言い換え | 200 | 0 |
非言い換えの再現率:0%。負例はすべて見逃されている。
PAWS
崩壊ビジュアライザ
アーカイブ上の所見 · 400 回の決定この言い換えタスクで、INT8 の Qwen2.5-0.5B システムは毎回「言い換え」と答えた。答えの半分は正しい。残りの半分は、第二のクラスを一度も選ばない分類器であることを明らかにする。
プロットを左右にスワイプすると、二つのクラスを比較できる。
どの入力にも同じ答え。真のクラスは二つとも同じ予測カテゴリに入る。正解率だけを見ると、この失敗は隠れてしまう。
色と形は真のラベルを表す。ラベルを表示すると、予測を一つも変えずに二つの群を分けられる。
詳細:混同行列とそこから言えること
| 真のラベル | 言い換えと予測 | 非言い換えと予測 |
|---|---|---|
| 言い換え | 200 | 0 |
| 非言い換え | 200 | 0 |
観測:予測の完全な崩壊。未解決:表現の偏り、情報の損失、学習済みの読み出しヘッド、あるいはパイプラインの別の問題のいずれが原因かは分かっていない。ラベルが同一であっても、隠れ状態表現が同一であることの証明にはならない。
このプロットは検証済みの件数を再構成したものであり、マークは個々のサンプル ID と対応しない。確率スコア、埋め込みの幾何、分離可能な代替モデルを創作してはいない。台帳は照合したが、論文のために推論を再実行してはいない。
スクラッチパッドには役割がある。
多段階の数学では、モデルは中間の量を保持し、正しく使う必要がある。書き出しの作業領域を取り除くと、答えに至る有用な経路を失うことがある。
卵が 18 個ある屋台を考える。3 個を手元に残し、5 個を焼き菓子に使い、残りを 1 個 2 ドルで売る。計算は短いが、各ステップが次のステップへ情報を渡している。
説明用の問題であり、採点対象の問題でも、アーカイブされたプロンプトの再構成でもない。
GSM8K:深刻な経験的盲点
| アーカイブ | 正解 | 正解率 |
|---|---|---|
| 2B GPU | 3 / 30 | 10.00% |
| 0.5B CPU | 53 / 200 | 26.50% |
四択を一様に推測した場合の期待正解率は 25% である。CPU の 95% Wilson 区間は 20.87–33.02% で、このベースラインを含む。
失敗は不可能性の証明ではない。
これらの構成の成績は低い。しかしアーカイブは、同一のモデルをスクラッチパッドの有無で比較していない。したがって、思考の連鎖の欠如が誤りの原因であることも、順伝播のみのモデルがすべて算術に失敗することも示せない。
GPU スライスでは正答がすべて A の位置にあるため、常に A を選べば 100% になる。CPU スライスでは A–D が均等である。GPU の誤り記録には、出所が未解決で不完全なプロンプトのプレビューも含まれる。ラベル位置、サンプル数、プロトコルが異なるため、対応のある比較はできない。
書く量は減らせる。
それでも
証明すべきことは多い。
表現がすでに取り出せる形で答えを含んでいるなら、隠れ状態の決定ヘッドは有用になりうる。これは「無料の推論」よりも狭く、より検証しやすい主張である。
次に決め手となる実験では、サンプル、プロンプト、候補、モデルを固定したうえで、直接読み出し、候補スコアリング、生成による推論、学習済みの潜在再帰を比較すべきである。正解率と併せて、すべてのバックボーン呼び出し、生成トークン、エンドツーエンドの遅延を測定する。
問うべきは「どれだけ速く決めたか」だけではない。「どの計算がその決定を信頼できるものにしたか」である。
出典と読解ガイド
論文 1——トークン生成ゼロ意思決定回路:自己回帰モデルにおける順伝播ゲーティングの表現力の限界と経験的限界。
本コンパニオンは、提供された draft.md と paper.texに基づく。説明のための比喩と対話的な図解を加えるが、新たなモデル実験は加えない。
視覚素材、スタイル、スクリプト、および IBM Plex Mono のラテン文字サブセットはすべて埋め込み済みである。日本語の字形には端末のシステムフォントを用いる。このファイルをブラウザで直接開けばよく、ネットワーク接続は不要である。
理論: §3、命題 3(パリティ)、命題 4(パイプラインの閉包)、定理 1–2(条件付きの追跡限界と再帰)。
スコア: §§5.2–5.3。マクロ平均とマイクロ平均は §5.6。失敗: §§6.1–6.2。来歴: §6.5 と付録の主張–証拠対応表。
監査成果物: evidence/audit.py、evidence/revision_checks.py、およびevidence/failure-mode-diagnostics.json。件数の照合は推論の再実行ではない。
Gen-Zero のモデル構成
とニューラル・パイプライン
凍結した言語モデルが表現と尤度を提供する。専用の決定経路、整列経路、リスク経路は、それらを異なる方法で利用する。空間世界モデルは独立した学習ブランチである。各層を調べ、テンソル形状を確認してほしい。
コード監査: · gen-zero @ dc0c2133f059。実線の矢印は実装済みのデータフロー、破線の矢印は提案段階のディスパッチ契約を表す。これらの構成要素は、一体として配備された単一の直列パイプラインではない。
すべてのフローを表示中。層を選ぶと、その次元と証拠を確認できる。
画面が狭い場合は図を横にスクロールしてほしい。各層はキーボードで選択できる。出典注記にはテキスト版もある。
モデルの層を調べる
任意のボックスを選ぶと、テンソル次元、仕組み、実装上の限界を確認できる。Tab で移動して Enter またはスペースを押すか、ポインタで選択する。
実装の証拠とアーキテクチャの境界
バックボーンの来歴。 Qwen2.5-0.5B(d=896)、Qwen3.5-2B、Qwen2.5-72B(d=8192)、LLaMA-70B(d=8192)が文書化された階層である。要求された対象は LLaMA-3.3-70B だが、保持されている大規模モデルの抽出メタデータは LLaMA-3.1-70B を示している。検証済みの 3.3 の抽出結果はまだ確立されていない。
学習の範囲。 これらの経路では Transformer の重みは凍結されたままである。意味的ゲートはラベル付きの文脈内例 16 個と差分対数尤度(PMI)を用い、安全ヘッドを学習しない。空間モデルには学習済みの結果/報酬ヘッドが残り、教師ありの整列ヘッドも存在する。「バックボーンを微調整しない」ことは、下流の学習がないことを意味しない。
v0.1.0 · Fail-Closed. v0.1.0:全6エンジンで F01–F09 に合格(11/11テスト)。形式的な Fail-Closed ゲートは非有限の無効な結果を拒否する。ブラウザのラッチは安全契約の例示であり、ソフトウェアテストは物理的なモーター停止を認証するものではない。
crates/gen-zero-model/src/choice_head.rs:ActionId の正準ソートと単体 ETF の幾何、Sₖ ⊂ ℝᵏ⁻¹。保持されている Rust の直接ベンチマークは、表現と候補の同一性を固定した条件で、同一性の反転が 0/16,232 回(0.00%)であったと報告している。確率の最大ずれは 5.96 × 10⁻⁸。論文上の証拠:equivariant-choice-head/evidence/revision/results.json。python/gen_zero/world_model/neural_dynamics.py:[B,64] 状態 + [B,16] 行動 → [B,80] 連結 → Δz=f(z,a) → z′=z+Δz。学習済みの sigmoid 結果ヘッド。次元は空間設定に由来し、汎用のクラス定数ではない。benchmarks/suites/geometric_latent_fusion.py:直交 Procrustes 診断と、対応付き SVD のコア/残差特徴。benchmarks/suites/evaluate_manifold_pareto_ensemble.py:教師ありの正規化 logit 融合。幾何学的射影とは別物である。docs/zero/29-pubmedqa-aegis-unified-manifold-evaluation-closure.md:PubMedQA 78.40%(196/250)、選択されたのは二ヘッド融合。Aegis Track A 81.60%(204/250)、選択されたのは LLaMA 単独ヘッド。これらの記述的な結果は統計的な優位を証明しない。python/gen_zero/service/semantic_risk.pyとpython/gen_zero/service/risk_data/report.json:凍結した 0.5B、16-shot ICL、3 通りの順序、重なり合うウィンドウ、PMI スコアリング。AUC 0.944。診断用 τ=0.50 は危険なリクエスト 18/18 件と良性のリクエスト 7/18 件にフラグを立てた。稼働中のしきい値は 0.4494 / 0.7620 である。
全層のテキスト版
凍結バックボーンの重み
トークン ID [B, T] → 隠れ状態 [B, T, d]。Qwen2.5-0.5B は d=896、アーカイブされた Qwen-72B と LLaMA-70B の特徴は d=8192 を用いる。ここでの Qwen-2B は Qwen3.5-2B である。要求された対象は LLaMA-3.3-70B だが、保持されている抽出メタデータは LLaMA-3.1-70B を示すため、これらの測定は 3.3 のチェックポイントを検証できない。凍結とはバックボーンを微調整しないという意味であり、教師ありの下流ヘッドと空間ダイナミクスは依然として学習を要する。
空間入力 · d=64 + 16
これらは設計された空間特徴であり、Transformer の隠れ状態から射影したものではない。評価に用いた空間設定では z と a を連結して [B, 80] とする。このクラスは状態と行動の次元を設定できる。
隠れ状態の読み出し · [B, T, d] → [B, d]
回答トークンを生成せずに、順伝播から隠れ状態を読み出す。プーリングの方式はエンコーダごとに異なり、アーカイブされた大規模モデルの特徴は最終トークン・プーリングを用いる。CPU の候補選択経路は、プロンプト・キャッシュを使って候補の続きも評価する。したがって、出力トークンがゼロであっても、バックボーン呼び出しが 1 回であることや推論コストがないことを意味しない。
意味的スコアリング · スカラーのリスク
各リクエストウィンドウについて、log P(" dangerous") − log P(" safe") から空リクエストの対数オッズを引く。三つの提示順序で平均をとり、最もリスクの高い重なりウィンドウを用いて sigmoid を適用する。この意味的ゲートは、新たに学習したニューラル安全分類器を使わない。ラベルの logit は凍結モデルに由来し、モデルは説明を生成しない。
残差空間ダイナミクス · 80 → 64
neural_dynamics.py は LayerNorm と GELU を備えた残差 MLP を用いる。独立した学習済みの sigmoid 結果/報酬ヘッドは [B] を返す。これは現行コードに残っており、凍結した意味的リスクゲートとは別物である。このクラスの既定の隠れ幅は 128 で、残差ブロックを二つ含む。チェックポイントの設定が正本である。
決定の幾何 · k 個の行動 → k−1 次元
gen-zero-model / choice_head.rs は安定した ActionId をソートし、共有表現を正単体 ETF へ射影し、正準順序でスコアを付け、確率を呼び出し側の順序へ戻す。決定が適切に定義されるには、一意な ID、有効な次元、有限の入力、決定的な同点処理が必要である。シャッフルの際、候補の構成、同一性、共有表現は不変でなければならない。
整列と融合は別経路
直交 Procrustes は XᵀY の SVD から得られる R=UVᵀ を用いる。GeometricLatentFusion はこの写像を診断情報として保存する。その特徴は、対応付き SVD の軸、スケールを合わせたコア平均、および残差を用いる。教師ありヘッドはラベルから学習する。PubMedQA で採用された経路が組み合わせるのは正規化したヘッドの logit であり、Procrustes 座標ではない:0.75 Qwen + 0.25 LLaMA。
稼働中のしきい値と診断用 τ=0.50
チェックインされたサービスは二つの境界を用いる。0.4494 でエスカレーション、0.7620 で強制停止である。τ=0.50 は論文の二値分析用しきい値であり、稼働中のポリシーではない。保存済みの 36 件では、危険なリクエスト 18/18 件と良性のリクエスト 7/18 件にフラグを立てた。稼働中の階層は、危険な事例に対して停止 12 回 + エスカレーション 6 回、良性の事例に対してエスカレーション 9 回を生じる。
NaN / Inf 安全境界 · v0.1.0 Fail-Closed
v0.1.0:全6エンジンで F01–F09 に合格(11/11テスト)。形式的な Fail-Closed ゲートは非有限の無効な結果を拒否する。ブラウザのラッチは安全契約の例示であり、ソフトウェアテストは物理的なモーター停止を認証するものではない。
シャッフル結果 · 測定済み・範囲限定
保持されている Rust の直接ベンチマークは、小集合の全順列と、シード付きの大きな集合のシャッフルにおいて、同一性の反転を 0/16,232 回(0.00%)観測した。整列後の確率の最大ずれは 5.96 × 10⁻⁸ である。実装が仮定する有効な入力の下では、正準ソートによりメニュー順序への依存が取り除かれる。これは意味的な正しさを証明せず、候補内容、プロンプト文脈、モデル出力の変化に対する不変性も証明しない。ページ上のシャッフル場は教育用のシミュレーションである。
評価 · 選択された構成
PubMedQA は fuse0.75+bbp|raw(二ヘッドの正規化 logit 融合)を選択した。Aegis Track A は llama+bbp|raw(単一モデルのヘッド)を選択した。これらは記述的なローカルテストの結果であり、検証済みの SOTA でも、一般に成り立つ整列の利得でもない。両タスクのマクロ bootstrap 区間はゼロを含む。
リスクの証拠 · 小規模な精選スイート
AUC は 0.944444 で、危険なリクエスト 18 件と良性の保存済みリクエスト 18 件から得た。τ=0.50 では危険の再現率は 18/18 で、良性へのフラグが 7 件ある。素の chmod の回帰プローブは依然として検出されない。実装は実際の計算時間を記録する。プロンプトのキャッシュは繰り返しの準備を減らすが、推論遅延をなくすものではない。
ディスパッチ契約 · 提案段階・未配備
提案されているモニタは、ディスパッチの前に予測状態、スコア、形状を検証する。無効な値は永続的な停止状態を設定し、制御されたリセットまで後続のモデル呼び出しと行動を阻止する。これは必要とされるハードウェア安全境界の記述であり、現行コードベースにある検証済みの物理ラッチではない。
Gen-Zero のシステム構成とフロー
Rust ランタイムは、入口、ポリシー、計画、決定ヘッド、暗号学的監査を接続する。下の図は責務ごとにまとめたものであり、実際の呼び出し経路は選択された動詞が決める。
ソース監査:2026 年 9 月 27 日 · gen-zero@dc0c2133f05954146e9738bce64bf15dd36ffbee。配線はソースコードで検証済みである。新たな配備やモデル評価を主張するものではない。
層を選ぶと、その実装と限界を確認できる。
ここで実装されていないもの
要求されていた AST パーサ + Linux capabilities スタック、物理的な衝突検査、および永続的なフェイルクローズド・ラッチは、いずれもこれらの Rust クレートに統合された実行経路ではない。無効入力の拒否とポリシーによるエスカレーションは存在するが、サンドボックスや物理的停止を構成するものではない。
これらのサービス経路は、決定とシミュレーション結果を返す。決定台帳は、外部の行動が実行されたことの証拠ではない。
リクエストからレスポンスまで
- 受け付けて束縛する。 CLI または MCP/HTTP サービスがリクエストを受け取る。ルータはマウント・スナップショットを取得し、経路固有のフィールドを検証して動詞を選ぶ。
- リクエストを評価する。 テキストの
ask、routeとimagineは、Python ブリッジから意味的リスクを取得する。リスクが欠落または無効な場合はエスカレーションし、強制停止の階層はその経路を遮断する。行動の選択時にはポリシー制約も適用される。 - 要求された経路を使う。 テキストの ask は意味的スコアリングを用いる。利用できない場合は、明示的にラベルを付けた first-feasible のフォールバックを用い、未評価のリスクは引き続きエスカレーションする。テキストの route は、ブリッジを実行できない場合に利用不可を報告する。数値計画は
gen-zero-plannerとgen-zero-worldmodelを用いる。simulate、what_if、およびシャドーのauditは未学習の事前分布を公開する。明示的な ETF ヘッドは、正準化した行動 ID と単体射影を用いる。数値の認知リクエストには、独自の幾何検証経路がある。 - ゲートを通し、記録して返す。 行動選択の経路は、ポリシーの判定とリクエストのリスクを組み合わせる。成功した
askの結果と、決定の追記を伴うpipeline decideの結果は、監査済みの結果を返す前に来歴台帳へ追記される。レスポンスは経路のメタデータを含むが、外部コマンドをディスパッチしない。
ソースマップと各層の完全な説明
入口層
gen-zero-cli · gen-zero-service — CLI は McpServer を起動するか、決定を送信する。サービスは stdio と HTTP/SSE で MCP を受け付け、REST 経路も提供する。zero ルータは不変のマウント・スナップショットを束縛し、動詞ごとにディスパッチする。これらは共有クレートを通る別々の経路である。
所在: /ebs/pj/gen-zero/crates/ 配下:gen-zero-cli/src/main.rs; gen-zero-service/src/server.rs; gen-zero-service/src/zero.rs
ゲートと安全
gen-zero-gate — PolicyGate は形式的制約、確認の登録、エントロピー、意味的リスク階層を扱う。既定の状態では、登録済みの制約も確認対象の行動もない。テキストの ask、route、imagine は Python の意味的リスクブリッジを用い、リスクが欠落または不正な形式の場合はエスカレーションする。シェルの AST 解析と Linux プロセス・ケイパビリティの強制は、この Rust ゲートに接続されていない。
所在: /ebs/pj/gen-zero/crates/ 配下:gen-zero-gate/src/policy.rs; gen-zero-gate/src/risk.rs; gen-zero-service/src/bridge.rs
計画とダイナミクス
gen-zero-planner · gen-zero-worldmodel — 数値の潜在変数リクエストは MCTS、MPC-CEM、A* を利用できる。サービスは未学習の残差ダイナミクスまたはシンプレクティック・ダイナミクスを公開し、有限入力の検査と終端での危険処理を行う。計画は、ゲートで強制停止となった候補を除外する。固定計画のシミュレーションは、遮断された行動もそのまま実行し、そのゲート階層を記録する。これはオフラインのダイナミクスによる絞り込みであり、検証済みの物理的衝突検査ではない。この Rust 経路には、永続的なフェイルクローズド実行ラッチは接続されていない。
所在: /ebs/pj/gen-zero/crates/ 配下:gen-zero-service/src/worldsim.rs; gen-zero-planner/src/pipeline.rs; gen-zero-worldmodel/src/dynamics.rs
決定コア
gen-zero-model — ActionETFChoiceHead(決定ヘッド、Softmax)は安定した ActionId をソートし、共有表現を正単体へ射影し、スコアを呼び出し側の順序へ戻して softmax を適用する。コアは決定的な近似同点規則を備える。サービスは明示的なヘッド・オプションを通じて ETF を公開する。通常のテキスト決定は意味的ブリッジを用いるため、ETF はすべてのリクエストの既定ヘッドではない。
所在: /ebs/pj/gen-zero/crates/ 配下:gen-zero-model/src/choice_head.rs; gen-zero-service/src/zero.rs
検証と監査
gen-zero-provenance — DecisionAuditEntry は直前の MMR ルートを含む。鍵付き BLAKE3 の Merkle Mountain Range が決定履歴をコミットし、包含証明を支える。成功した ask の結果と、決定の追記を伴う pipeline decide の結果が記録される。GENZERO_MMR_PERSIST_PATH による永続化は任意である。最後の 4,096 枚の葉が包含証明を保持し、信頼できるルートは外部で保管しなければならない。これは実行の監査ではなく、外部のシェルコマンドやモータの動作が実際に行われたことを証明しない。
所在: /ebs/pj/gen-zero/crates/ 配下:gen-zero-provenance/src/entry.rs; gen-zero-provenance/src/mmr.rs; gen-zero-service/src/zero.rs
関連するランタイム基盤には、 gen-zero-core(共有型)、gen-zero-lod(グラフ・ファクト)、gen-zero-storage(スナップショット)、および任意の gen-zero-nanocore 経路が含まれる。上下に示した論文の実験は研究上の証拠であり、このランタイム・マップの代わりにはならない。