白鼓挑战

AI 挑战人类最长小说纪录,状态全程可验证。
全球最难的 AI 写作考题:一致性。全球第一个敢这么做的挑战。

人类最长的长篇小说

人类最长的长篇小说,叫 Venmurasu(泰米尔语「白鼓」)。 26 卷,约 22,400 页。一个人,写了六年半。

它是人类耐力的纪念碑——写到第 20 卷还记得第 1 卷的人物,这本身就是奇迹。

现在,AI 要挑战这个纪录——而且更难

我们给自己加了一个人类作者不需要面对的难度:

「每一章的世界状态,都必须可验证。」

写到第 100 万字时,第 3 章埋的伏笔还记得收,第 9 章受的伤还记得疼, 谁在什么时候知道了什么,全都查得出来——不是靠模型记性好,是靠门禁把关。

人类写长篇小说,唯一的天花板是记忆。
AI 写长篇小说,过去连这个天花板都没有——写到 5 万字就穿帮。

方法:把世界状态从模型的脑子里搬出来

我们把世界状态从模型上下文里拆出来,变成持久化的对象。 每次改动 = 一个语义事务,五道门禁全过才落盘;违规零写入,理由返回重写。

  1. 正文非空——没有正文的章节不是章节。
  2. 结构引用——引用的每个实体都必须存在。
  3. 禁区约束——不可违反的约束。
  4. 伏笔状态机——埋下的线头,收没收、还开着。
  5. 正文对照——正文说的和状态记的必须一致。

这不是「生成 100 万字」——生成器一天能吐 100 万字,但第 5 万字就穿帮。 这是「AI 写出 100 万字还不穿帮」,是 AI 写作的珠穆朗玛峰。

诚实的基线

自建基准 ShadowBench-W 上,本方法的状态回写准确率:

2Origin 状态层裸模型向量 RAG
状态回写准确率(33 轮系列)98.9%75.0%75.0%

⚠️ 这是自建基准的口径,非第三方评测。探询修复后的权威对比(Run #27)为 95.8% ± 5.9 vs 52.1% ± 19.7 / 58.3% ± 11.8,p = 0.0024。全球没有第二家做「状态写回验证」的基准—— 考题是我们定义的,标准制定权在我们手里。

现在的进度(数字由 scripts/challenge-stats.mjs 生成,不手写)

正在读取 stats.json

drift-rate(模型记错前值率):上次实测 8.3%(2026-08-06;Run 编号未留存), 随下个里程碑按同协议重测后以「Run 编号 + 日期」更新。无编号的裸数字不上墙。

现在

每章世界状态可 clone 验证

M1

20 章已验证

主指标:可验证章数(字数只是副指标)

M2

50 章已验证

百万字不失忆的中途站

M3

100 章已验证

超过人类长篇平均长度的数量级

终极

破 22,400 页

超越人类纪录,且全程可验证

连载节奏(cadence)

公开停更比假装连续更值钱。停更区间如实标注:

规则(挑战本身也要可验证)

  1. AI 每写一章 = 提交一个语义事务(正文 + 状态变更)。
  2. 五道门禁全过才落盘。
  3. 违规零写入,理由返回重写。
  4. 每章正文 + 世界状态 + git commit 全部公开。
  5. 任何人都能 clone 验证:node adapters/story/cli.mjs state <pkg>

追连载

人类用了 6.5 年。AI 会用多久?不知道。但我们公开每一章:正文、世界状态、伏笔图谱、 时间线,全部可 clone 可验证。git log 就是证据链。

诚实边界

  • 目标尚未达成——这是挑战,不是成绩单。现在 ,里程碑在前方。
  • 实测基于单一模型(deepseek-v4-flash)、自造夹具。
  • 「98.9% vs 75%」是自建基准 ShadowBench-W 的口径,非第三方评测。
  • Venmurasu 事实已核实(26 卷 / 约 22,400 页 / 2014–2020,单人完成,Wikipedia 2026-08-06)。