一个可靠的下一步。
一段更不确定的旅程。
世界模型预测状态在动作之后如何变化。把它的预测反馈给自身,小误差就可能累积。操控智能体,然后切换视图,比较相同的动作历史。
尝试向右撞上墙。设想中的智能体也会停下吗?
已就绪。向上移动四步,再向右移动五步即可到达目标。
| 分层 | 样本 | 状态 MSE | 安全准确率 |
|---|---|---|---|
| 已见输入 | 1,102 | 0.010202 | 99.9093% |
| 新颖输入 | 590 | 0.024584 | 99.3220% |
新颖输入 MSE 约为已见输入 MSE 的 2.41 倍。准确率针对二元安全分类,不代表精确状态预测或导航成功。“分布内”和“分布外”在此表示同一验证划分中的已见输入与字节新颖输入;这并不能证明存在分布偏移。该差距支持记忆化假设,但无法确定其原因。
熟悉的输入更容易。
数据集包含 1,620 个回合中的 8,146 条转移:来自 1,296 个训练回合的 6,454 条转移,以及来自 324 个验证回合的 1,692 条转移。精确状态–动作输入在训练集中与 1,692 条验证行中的 1,102 条(65.13%)重复;尽管回合 ID 不相交,精确回合序列仍与 324 个验证回合中的 181 个(55.86%)重复。
更长的想象改变了问题。
自回归第十步的 MSE 达到 0.16989,但只有 39 个符合条件的回合。它们全部确实安全,因此这个远期结果无法告诉我们模型检测晚期危险的能力。
v0.1.0 发布:全六引擎 F01–F09 防线通过 11/11 项测试。下方天真客户端仅演示历史缺陷,不代表当前的 Fail-Closed 门控。
一个自信的分数。
一个不可能的状态。
NaN 是“不是一个数字”。一次损坏的转移即使空间模型独立的结果/奖励头返回自信且有限的分数,也可能包含 NaN。注入这种确切类型的故障,观察两个客户端如何分叉。
模式 A · 天真客户端模式
一个看似合理的分数绕过了无效状态。
已就绪,等待模拟推理周期。
模式 B · Fail-Closed 熔断保护模式
拟议 Fail-Closed 合约的示意。
已就绪。拒绝会持续锁存,直到执行受控重置。
- 00 · 监视器已布防。等待推理周期。
is_safe=True,并且分数有限,约为 0.999557。此面板演示了那条历史故障路径及拟议修复逻辑;论文没有修补或验证生产修复。当前 Rust 路由具有数值验证,但没有持久执行锁存;请见下方经源代码审计的运行时图。这里显示的三分量状态是对真实 64 维输出的教学简化。此处的不确定性诊断是合成的——被评估网络没有认识论不确定性估计器。模拟的调度阻断不是经过测试的物理电机停止。“不小于”并不意味着有效。
在 JavaScript 和 IEEE 风格比较中,NaN < 0.5 为 false。仅检查评分的防护器也可能因此失效。此处演示的是 v0.1.0 之前的历史客户端缺陷:状态中是 NaN,而安全头分数有限。奖励检查捕获不到它。
锁存会记住故障。
注入后,尝试正常周期。Fail-Closed 监视器会在下一次推理和调度发生前将其阻断。只有单独的受控重置才能清除锁存。在真实环境中安全停下仍是另一项责任。
制动下一时刻 = 制动当前 ∨ ¬放行
知道地图
就改变了游戏。
图规划器拿到了答案:精确转移和已知陷阱。学习型神经过滤器估计哪些候选看起来安全。比较它们掌握的信息,而不只是它们画出的路线。
预言机 · 精确图访问
精确转移 + 特权陷阱成员关系
东侧是已知的吸收陷阱。预言机将其剪除,绕行避开。
逐条边跟踪绿色路线。
神经过滤器 · 学习型估计
工程化状态 + 动作 → 预测状态 + 分数
东侧得分 0.96 并通过过滤器——即使隐藏环境中存在陷阱。
合成分数经过刻意错误排序,用于揭示阈值判断的局限。这里不测量推理速度或校准。
| 问题 | 特权图规划器 | 学习型神经动力学 |
|---|---|---|
| 未来来自哪里? | 精确的环境转移字典。 | 在 6,454 条训练转移上拟合的残差转移网络;完整数据集包含 8,146 条转移。 |
| 如何识别危险? | 直接访问真实陷阱成员关系。 | 学习型空间结果/奖励头,与冻结的语义风险闸门不同;高置信度不是证书。 |
| 评估了什么? | 构造的四个基本方向动作图诊断。 | 使用三个相对动作的离线预测与安全分类。 |
| 什么角色有充分依据? | 拥有特权信息的预言机参考。 | 离线估计器和候选快速安全过滤器;闭环安全性仍未确立。 |
阅读这些实验背后的证据边界
可预测性:精确字节重叠是对一次验证划分的事后分区。它没有消除共享布局、近似重复项或模型选择效应。报告的误差差距支持一个假设,但不能对记忆化作出因果诊断。
安全性:监视器的拒绝保证以完整中介、正确检查、原子化检查与调度,以及阻止执行的回退机制为条件。浏览器演示检查有限值、形状、分数范围和合成不确定性界限;它并非身份、检查点、中间值或物理回退验证的完整实现。
规划:名为 MCTS 的例程使用根节点赌博机分配与确定性的安全剪枝前瞻。该诊断专门构造来困住按坐标贪心的基线。其精确模型结果与神经模型的离线结果属于不同实验,动作接口彼此不兼容。
Gen-Zero 模型架构
与神经管线
冻结的语言模型提供表示和似然。专门的决策、对齐和风险路径以不同方式使用它们。空间世界模型是一个独立学习的分支。探索各层并查看其张量形状。
代码审计: · gen-zero @ dc0c2133f059。实线箭头表示已实现的数据流;虚线箭头表示拟议的调度契约。这些组件并非一条已普遍部署的串行管线。
所有流程可见。选择一个层以查看其维度和证据。
在窄屏上,请水平滚动图表。每层都可用键盘选择;源代码注释也提供文本版本。
检查一个模型层
选择任意方框查看其张量维度、机制和实现限制。使用 Tab,再按 Enter 或 Space,或使用指针选择。
实现证据与架构边界
骨干来源。 Qwen2.5-0.5B (d=896)、Qwen3.5-2B、Qwen2.5-72B (d=8192) 和 LLaMA-70B (d=8192) 是文档记录的层级。LLaMA-3.3-70B 是请求的目标,但保留的大模型提取元数据标识为 LLaMA-3.1-70B。尚未建立经过验证的 3.3 提取结果。
训练范围。 Transformer 权重在这些路径中保持冻结。语义门使用 16 个带标签的上下文示例和差分对数似然(PMI),不拟合安全头。空间模型仍有学习得到的结果/奖励头;监督对齐头也保留。“不对骨干微调”并不意味着没有下游训练。
v0.1.0 · Fail-Closed. v0.1.0:全六引擎 F01–F09 Fail-Closed 防线通过 11/11 项测试。形式化故障阻断门控拒绝非有限的无效结果。浏览器锁存器演示安全契约;软件测试不构成物理电机停止行为的认证。
crates/gen-zero-model/src/choice_head.rs:规范 ActionId 排序与 Simplex ETF 几何,Sₖ ⊂ ℝᵏ⁻¹。保留的直接 Rust 基准报告,在表示和候选身份固定时,身份翻转为 0/16,232(0.00%);最大概率漂移为 5.96 × 10⁻⁸。论文证据:equivariant-choice-head/evidence/revision/results.json。python/gen_zero/world_model/neural_dynamics.py:[B,64] 状态 + [B,16] 动作 → [B,80] 拼接 → Δz=f(z,a) → z′=z+Δz;学习得到的 sigmoid 结果头。维度来自空间配置,而非通用的类常量。benchmarks/suites/geometric_latent_fusion.py:正交 Procrustes 诊断与配对 SVD 核心/残差特征。benchmarks/suites/evaluate_manifold_pareto_ensemble.py:监督归一化 logit 融合,与几何投影不同。docs/zero/29-pubmedqa-aegis-unified-manifold-evaluation-closure.md:PubMedQA 78.40% (196/250),选定双头融合;Aegis Track A 81.60% (204/250),选定单一 LLaMA 头。这些描述性结果无法证明统计优势。python/gen_zero/service/semantic_risk.py和python/gen_zero/service/risk_data/report.json:冻结的 0.5B、16-shot ICL、三个顺序、重叠窗口、PMI 评分;AUC 0.944。诊断 τ=0.50 标记 18/18 个危险请求和 7/18 个良性请求。实时阈值为 0.4494 / 0.7620。
每层的文本版本
冻结的骨干权重
Token ID [B, T] → 隐藏状态 [B, T, d]。Qwen2.5-0.5B 使用 d=896;归档的 Qwen-72B 和 LLaMA-70B 特征使用 d=8192。此处 Qwen-2B 指 Qwen3.5-2B。LLaMA-3.3-70B 是请求的目标;保留的提取元数据标识为 LLaMA-3.1-70B,因此这些测量无法验证 3.3 checkpoint。冻结表示不对骨干微调;监督下游头和空间动力学仍需拟合。
空间输入 · d=64 + 16
这些是工程化空间特征,并非从 Transformer 隐藏状态投影而来。评估的空间配置将 z 和 a 拼接为 [B, 80]。该类支持可配置的状态和动作维度。
隐藏状态读出 · [B, T, d] → [B, d]
从前向计算读取隐藏状态而不生成答案 token。池化方式由编码器决定;归档的大模型特征使用最后 token 池化。CPU 候选选择路径还会使用提示缓存评估候选续写。因此,零输出 token 并不意味着只调用一次骨干模型或没有推理成本。
语义评分 · 标量风险
对于每个请求窗口,从 log P(" dangerous") − log P(" safe") 中减去空请求的对数几率。对三个演示顺序取平均;使用风险最高的重叠窗口并应用 sigmoid。这个语义门不使用新训练的神经安全分类器。标签 logits 来自冻结模型;它不会生成解释。
残差空间动力学 · 80 → 64
neural_dynamics.py 使用带 LayerNorm 和 GELU 的残差 MLP。一个独立学习的 sigmoid 结果/奖励头返回 [B];它仍在当前代码中,并与冻结的语义风险门不同。该类默认隐藏宽度为 128,包含两个残差块;checkpoint 配置具有权威性。
选择几何 · k 个动作 → k−1 个维度
gen-zero-model / choice_head.rs 对稳定的 ActionId 排序,将共享表示投影到规则单纯形 Simplex ETF,按规范顺序评分,再将概率映射回调用方顺序。定义良好的决策依赖唯一 ID、有效维度、有限输入和确定性的并列处理。在洗牌下,候选成员、身份和共享表示必须保持不变。
对齐与融合是独立路径
正交 Procrustes 使用 XᵀY 的 SVD 得到 R=UVᵀ。GeometricLatentFusion 将该映射存为诊断;其特征使用配对 SVD 轴、尺度匹配的核心平均和残差。监督头从标签学习。PubMedQA 获胜路径组合归一化头 logits,而非 Procrustes 坐标:0.75 Qwen + 0.25 LLaMA。
实时阈值与诊断 τ=0.50
签入服务使用两个边界:0.4494 用于升级,0.7620 用于紧急制动。τ=0.50 是论文的二元分析阈值,而非实时策略。在存储的 36 个案例中,它标记 18/18 个危险请求和 7/18 个良性请求;实时层级对危险案例产生 12 次紧急制动 + 6 次升级,对良性案例产生 9 次升级。
NaN / Inf 安全边界 · v0.1.0 故障阻断
v0.1.0:全六引擎 F01–F09 Fail-Closed 防线通过 11/11 项测试。形式化故障阻断门控拒绝非有限的无效结果。浏览器锁存器演示安全契约;软件测试不构成物理电机停止行为的认证。
洗牌结果 · 已测量、有范围
保留的直接 Rust 基准在穷举小集合排列和带种子的较大集合洗牌中观察到 0/16,232 次身份翻转(0.00%);最大对齐概率漂移为 5.96 × 10⁻⁸。在实现的有效输入假设下,规范排序消除了对菜单顺序的依赖。这不是语义正确性的证明,也不证明对候选内容、提示上下文或模型输出变化的不变性。页面的洗牌区域是教学模拟。
评估 · 所选配置
PubMedQA 选定 fuse0.75+bbp|raw(双头归一化 logit 融合)。Aegis Track A 选定 llama+bbp|raw(单模型头)。这些是描述性的本地测试结果,不是经验证的 SOTA 或普遍的对齐增益。两个任务的宏观 bootstrap 区间包含零。
风险证据 · 小型精选套件
AUC 为 0.944444,来自 18 个危险和 18 个良性存储请求。在 τ=0.50 时危险召回率为 18/18,并有七个良性标记。裸 chmod 回归探针仍然漏检。实现记录真实计算时间;缓存提示减少重复设置,但不会消除推理延迟。
调度契约 · 拟议、未部署
拟议的监视器会在调度前验证预测状态、分数和形状;无效值会设置持久紧急制动,阻止后续模型调用和动作,直到受控重置。这描述所需的硬件安全边界,并非当前代码库中已验证的物理锁存器。
Gen-Zero 系统架构与流程
Rust 运行时连接入口、策略、规划、决策头和加密审计。下图按职责分组;所选动词决定实际调用路径。
源代码审计:2026年9月27日 · gen-zero@dc0c2133f05954146e9738bce64bf15dd36ffbee。源代码验证的连接关系;不声称有新的部署或模型评估。
选择一个层以查看其实现和限制。
此处未实现的内容
请求的 AST 解析器 + Linux capabilities 堆栈、物理 碰撞检查 以及持久化的 Fail-Closed 熔断保护锁存器,在这些 Rust crate 中并未形成集成执行路径。无效输入拒绝和策略升级已经存在;它们不构成沙箱或物理停止。
这些服务路径返回决策和模拟结果。决策账本不构成外部动作执行的证据。
从请求到响应
- 进入并绑定。 CLI 或 MCP/HTTP 服务接收请求。路由器捕获其挂载快照,验证特定路径字段并选择动词。
- 评估请求。 文本
ask、route和imagine从 Python 桥接获取语义风险。缺失或无效风险会升级;紧急制动层级会阻止该路径。选择动作时同样应用策略约束。 - 使用请求的路径。 文本 ask 使用语义评分;不可用时使用明确标注的 first-feasible fallback;未评估的风险仍会升级。文本 route 在桥接无法运行时报告不可用。数值规划使用
gen-zero-planner和gen-zero-worldmodel;simulate、what_if和 shadowaudit暴露未经训练的先验。显式 ETF 头使用规范 action IDs 和单纯形投影。数值认知请求有自己的几何验证路径。 - 门控、记录并返回。 动作选择路径将策略判定与请求风险结合。成功的
ask结果以及带有 decision append 的pipeline decide结果,会在返回审计结果前追加到来源账本。响应包含路径元数据;不会调度外部命令。
源代码映射与完整层级说明
入口层
gen-zero-cli · gen-zero-service — CLI 启动 McpServer 或提交决策。服务通过 stdio 和 HTTP/SSE 接受 MCP,也提供 REST 路径。其 zero router 绑定不可变挂载快照并按动词调度;这些是经由共享 crate 的不同路径。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-cli/src/main.rs; gen-zero-service/src/server.rs; gen-zero-service/src/zero.rs
门控与安全
gen-zero-gate — PolicyGate 支持形式化约束、确认注册、熵和语义风险层级。默认状态没有已注册的约束或确认动作。文本 ask、route 和 imagine 使用 Python 语义风险桥接;缺失或格式错误的风险会升级。Shell AST 解析和 Linux 进程 capability 强制执行未接入此 Rust gate。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-gate/src/policy.rs; gen-zero-gate/src/risk.rs; gen-zero-service/src/bridge.rs
规划与动力学
gen-zero-planner · gen-zero-worldmodel — 数值潜在请求可使用 MCTS、MPC-CEM 或 A*。服务公开未经训练的残差或辛动力学,并带有有限输入检查和终止状态危险处理。规划会过滤被门控紧急制动的候选;固定计划模拟仍会执行被阻止的动作步骤,并记录其门控层级。这是离线动力学过滤,未验证物理碰撞检查。此 Rust 路径未接入持久 Fail-Closed 熔断保护执行锁存器。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-service/src/worldsim.rs; gen-zero-planner/src/pipeline.rs; gen-zero-worldmodel/src/dynamics.rs
决策核心
gen-zero-model — ActionETFChoiceHead 对稳定 ActionId 排序,将共享表示投影到规则单纯形,将分数散射回调用方顺序并应用 softmax。核心包含确定性的近似并列规则。服务通过显式头选项公开 ETF;普通文本决策使用语义桥接,因此 ETF 并非每个请求的默认头。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-model/src/choice_head.rs; gen-zero-service/src/zero.rs
验证与审计
gen-zero-provenance — DecisionAuditEntry 包含前一个 MMR 根。带密钥的 BLAKE3 Merkle Mountain Range 提交决策历史,并支持包含证明。成功的 ask 结果以及带有 decision append 的 pipeline decide 结果会被记录。通过 GENZERO_MMR_PERSIST_PATH 持久化是可选的;最近 4,096 个叶子保留包含证明,且必须在外部保留可信根;这不是执行审计,不能证明外部 shell 命令或电机动作确实运行。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-provenance/src/entry.rs; gen-zero-provenance/src/mmr.rs; gen-zero-service/src/zero.rs
相关运行时基础设施包括 gen-zero-core(共享类型)、gen-zero-lod(图事实)、gen-zero-storage(快照)以及可选的 gen-zero-nanocore 路径。论文下方或上方的实验是研究证据,不能替代这张运行时映射图。