GEN-ZERO 主页 论文 突破白皮书 案例
[EN|中文|日本語]

案例研究 01 · 硬实时神经符号控制

俄罗斯方块极限验证:硬实时控制下的神经符号代际飞跃

为什么组合型硬实时控制会击穿生成式 LLM,以及 Gen-Zero 如何应对:今天靠形式化安全门禁,微秒级反射列入路线图。

日期: 2026-09
延迟(p50,本浏览器实测): 尚未测量
40 行时的封闭空洞(实测): 尚未测量
Token 消耗: 0 Tokens($0.00)

互动竞技区

自动演示展示参考控制器。亲自上手把操作交给你;此时门禁只统计它本会否决的落子。点击下方基准测试按钮,将在您的 CPU 上运行 20 个固定随机种子(1000–1019)至 40 行,并将实测结果写入顶部信息栏与第 3 节。

1. 组合状态爆炸:自回归生成模型撞上物理极限

层层叠加的分支因子

只允许从出生点硬降、不做旋转技时,空的 10 列棋盘上一个方块最多有 34 种不同落点(T、J、L),I、S、Z 为 17 种,O 为 9 种,七种方块平均约 23 种。这些数字直接来自竞技场引擎,并由单元测试锁定。因此前瞻 4 块最多对应 34⁴ = 1,336,336 种落点序列,还没算之后的随机方块。离线俄罗斯方块连近似求解都是 NP 难的 [1],任何实时控制器都必须剪枝,而且要剪得好。

物理时钟

60 Hz 下一帧是 16.7 ms。20G 重力下方块在一帧内就落到堆顶,剩下的只有锁定延迟:规范作品里不到一秒,街机 20G 模式里更短。以文本写出决策的控制器,要一个 Token 一个 Token 地为这一步付费:

t决策 ≥ t首 Token + N输出 / r解码 + t网络

这是算术,不是测量。假设一步落子写成约 40 个输出 Token,解码速率 50–100 Token/秒:仅解码就要 0.4–0.8 秒,还没算首 Token 等待、网络往返,以及推理模型每步动辄数百到数千个隐藏推理 Token。即使在这些有利假设下,一次决策也横跨几十帧。本页没有对任何托管 LLM 计时;把假设换成你自己的数字,下界随之可得。

解码器每一步都要重新推导的空间规则

文本生成型智能体从序列化的棋盘预测下一个 Token。这个循环里没有任何环节检查所说的落点是否合法、是否能经 SRS 踢墙表到达、是否不产生新空洞:碰撞、旋转、消行都是精确的离散规则,模型每一步都得从文本里重建它们。本页没有测量 LLM 的非法落子率或空洞率,因此不对此作任何数值断言。工程结论并不需要这个数字:无论提出落子的是神经网络还是符号程序,下游都需要一个精确的检查器。竞技场实现的正是这个检查器。

2. Gen-Zero 的双轨神经符号解法

Gen-Zero 把控制拆成快速的神经提议者和精确的符号验证者,二者之间是一段始终停留在结构化状态上的搜索。标签写明了哪些今天已存在,哪些还没有。

2. Gen-Zero 的双轨神经符号解法 棋盘状态 + NEXT 队列 轨道 1 · MAMBA-2 反射 目标 < 0.2 ms · 尚未实现 路线图 轨道 2 · 前瞻搜索 束宽 16 · 深度 3 · 零 Token 本页已实现 排序后的提案 轨道 3 Δholes ≤ 0 本页已实现 否决 → 下一个提案 轨道 3 · 安全门禁 仅当 Δholes ≤ 0 放行 通过 落下方块 无可放行落子 → 最不坏的一步 + 失守计数(自动演示时附警告)
查看 Mermaid 源码
flowchart LR
    S["Board state + Next queue"] --> T1["Track 1: Mamba-2 reflex<br/>ROADMAP, not implemented"]
    S --> T2["Track 2: Lookahead search<br/>beam 16, depth 3, zero tokens"]
    T1 -.-> R["Ranked proposals"]
    T2 --> R
    R --> G{"Track 3: gate<br/>admit iff delta_holes <= 0"}
    G -- pass --> A["Place piece"]
    G -- "veto: next proposal" --> R
    G -- "no admissible move" --> B["Least-bad move<br/>+ breach counter (+ warning in autoplay)"]
    B --> A
    classDef roadmap fill:#12151A,stroke:#8E949A,color:#8E949A,stroke-dasharray:5 4;
    classDef live fill:#0e1218,stroke:#2FE3F0,color:#ECE7DC,stroke-width:2px;
    classDef gate fill:#0e1218,stroke:#FFA51F,color:#ECE7DC,stroke-width:2px;
    class T1 roadmap;
    class S,T2,R,A live;
    class G,B gate;
轨道 1 · 设计目标 · 尚未实现

Mamba-2 亚毫秒神经反射

设想:一个选择性状态空间模型 [3] 读取棋盘,在 0.2 ms 内为每个候选落点给出地表凹凸度与下潜通路的评分。这是目标,不是测量:目前没有训练或接入任何 Mamba-2 模型。竞技场里由六特征 El-Tetris 打分器(落点高度、消除格数、行转换、列转换、空洞、井;权重取自 [2])代替这条轨道。

轨道 2 · 本页以显式状态搜索实现

完全不生成 Token 的前瞻搜索

竞技场搜索当前方块加后两个预览块(深度 3),每层保留 16 个棋盘的束宽。落点限于在出生点旋转、平移、硬降可达的位置;不搜索塞入和旋转技。全程不产生任何 Token。在学习到的状态嵌入上进行的隐空间版本属于路线图。

轨道 3 · 本页以精确检查实现

形式化安全门禁:零新增空洞不变式

设 H(b) 为棋盘 b 中上方同列存在已填格的空格数。门禁仅当 H(place(b, a)) − H(b) ≤ 0 时放行落子 a,并沿搜索的排序依次往下找,直到有一步通过。这是精确的整数检查,不是求解器。当没有任何合法落子能通过时,方块仍然必须落下:竞技场执行最不坏的一步并计入一次失守;计数显示在屏幕上,自动演示时还会在控制台记录警告。不变式在可行时一律执行;它不是保证,每次失守页面都会报告。

Gen-Zero 另有一个 CP-SAT 门禁(Google OR-Tools [4]),属于其调度基准,并未接入本竞技场。在 2026-09 的 B3 证据运行中,它在 1,000 次求解里拒绝了 242/242 个违规提案,求解 p99 为 9.12 ms;其中 103 次求解返回 UNKNOWN 并走了降级路径,B3 总体验收结论为 NOT_ACCEPTED。证据包:Gen-Zero 仓库 benchmarks/results/b3_evidence。

3. 实测基准评分卡

Gen-Zero 一列在竞技场的基准测试完成后填入。其余各列有意留空。

指标GPT-4o 智能体Claude 3.5 Sonnet 智能体DeepSeek-R1Gen-Zero 参考控制器(本浏览器实测)
单步中位延迟(p50)未测未测未测尚未测量
99 分位延迟(p99)未测未测未测尚未测量
批量平均延迟未测未测未测尚未测量
决策吞吐(块/秒,仅计算)未测未测未测尚未测量
40 行竞速完成率未测未测未测尚未测量
结束时平均封闭空洞数未测未测未测尚未测量
门禁失守次数(20 局合计)未测未测未测尚未测量
单局 Token 消耗与成本未测未测未测0 Token · $0.00(无网络请求)

为什么 LLM 列是空的。我们没有在统一的测试框架下运行这些智能体,所以不发布它们的数字。用厂商页面或直觉去填这些格子,正是本页要拒绝的那类断言。让每个智能体跑同样 20 个种子、过同一个门禁的测试框架,是后续工作。

方法。种子 1000–1019,带种子的 7-bag,打到 40 行或 1,000 块即停止。搜索深度 3,束宽 16,之后过 Δholes ≤ 0 门禁。决策耗时为 performance.now() 包住搜索加门禁的时间。浏览器会降低该时钟精度(竞技场会显示实测分辨率),所以 p50 与 p99 可能被量化;批量平均(总耗时 ÷ 决策数)不受影响。这里的吞吐只算计算:每秒 CPU 时间内的决策数,不是动画演示速度。结果取决于你的设备。

4. 从方块到现实工业世界

能迁移的是这套模式:快速提议者、停留在结构化状态上的搜索、能说"不"的精确门禁。Gen-Zero 目前没有部署在下列任何领域。每张卡片写明该领域需要的门禁,以及本页没有展示的内容。

金融

高频量化交易

提议者给订单排序;门禁在订单发出前把事前风控限额(持仓、名义金额、价格带)作为精确约束检查。本页未展示:那里的预算是微秒级,而本控制器是毫秒级 JavaScript,需要原生移植和交易所级测试。

机器人

敏捷机器人与四足机械狗

感知到运动的反射弧按控制频率提出下一个动作;门禁强制关节限位以及接触与稳定性约束。本页未展示:硬实时需要有界的最坏执行时间和认证。浏览器里的 p99 不是最坏情况上界。

基础设施

超算与数据中心能耗与流量调度

提议者给出放置与限流建议;门禁拒绝任何会在等待图中形成环、或突破功率上限的提交。Gen-Zero 论文二在合成环境中研究死锁规避。本页未展示:任何生产调度器。

参考文献

  1. [1] E. D. Demaine, S. Hohenberger, D. Liben-Nowell. Tetris is Hard, Even to Approximate. COCOON 2003.
  2. [2] I. El-Ashi. El-Tetris: An Improvement on Pierre Dellacherie's Algorithm. 2011.
  3. [3] T. Dao, A. Gu. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality. ICML 2024.
  4. [4] L. Perron, F. Didier. CP-SAT. Google OR-Tools.
  5. [5] Tetris Guideline. Super Rotation System (SRS) wall-kick tables.

引用本案例

@misc{genzero2026tetris,
  title        = {The Tetris Proof: Real-Time Neurosymbolic Superiority},
  author       = {{Gen-Zero Research Team}},
  year         = {2026},
  month        = sep,
  howpublished = {\url{https://gen-zero.ai/cases/tetris.html}},
  note         = {Case Study 01. Reference symbolic controller measured live in the
                  reader's browser; LLM baselines not benchmarked}
}