2Origin 协议 · Origin IR · v0.1

从影子,回到本源

一套面向 AI 的持久对象表示层。AI 不再去改 PDF、改截图——那些是影子的影子—— 它改的是本源,而系统负责证明:这次改动真的对了。

15.0%/27.5%
可溯源证据字段占比 · 全套机制(A3)
0%
可溯源证据 · 所有纯提示词基线
+41.3pt
A0→A2(只加一句提示词),p=3.3×10⁻⁵
+2.5pt
A2→A3(全套机制),不显著
本源 AI 计算机 · 研究原型

从持久对象,到真实多 AI 协作。

模型是 CPU,但 CPU 从来不等于一台计算机。从熟悉的主板比喻出发,了解本象、南北桥、持久状态与动作系统如何组成整机,再看多宿主诊断、事务验收和检查点接力的真实案例。

了解本源 AI 计算机与案例 →
病根

AI 读到的,是影子的影子From shadow to shadow

真实建筑 → CAD 模型 → 平面图 → PDF → 截图 → OCR 文字。 每一步都更好传播,每一步都丢掉一些东西。AI 今天读到的,正是这种压缩了七八轮的 投影的投影——而我们竟然把最后那层影子当成了源文件。

感知

AI 没有眼睛

它能生成 Word、Excel、PPT、CAD,却没有稳定的「打开-看见-定位-修改-复验」系统。 读到的往往是截图的 OCR、摘要的摘要。

记忆

上下文必炸

聊天记录被当成项目状态。聊得越久越接近内存爆满,压缩摘要不断失真——状态和对话被混为一谈。

输出

终态不稳

AI 直接吐完整成品:几十页 PPT、百万字全文、几百行图表配置。内容、格式、引用一起失控, 错了只能整个重来。

病根只有一句话:我们把投影当成了对象本身。
解法也只有一句话:把本源留住,影子按需投影。
一源万影 ·「圣人立象以尽意」——《易传·系辞》 · Save the origin, project on demand.
协议

不是更大的 JSON,而是持久的对象层Origin IR

2Origin 同时保存七样东西。AI 只提交语义事务——改了什么、依赖什么、断言什么。 确定性的编译器校验、落地、生成终态。违规就带着证据退回重写,一个字节都不写

Word / CAD / Excel / 视频 / 网页 / 对话 ↓ 导入 本象 IR(Origin IR)— 对象 · 语义 · 关系 · 状态 · 约束 · 来源 · 边界 ↓ 输入侧编译(Context Compiler) 视觉地图 + 对象图 + 精确片段 + 可用动作 → AI ↓ AI 输出语义事务 输出侧编译(Commit Compiler) 校验约束 → 更新状态 → 留存证据 → 重新投影 ↓ PDF / 图片 / 文字 / 三维 / 界面(按需生成的投影)
「对话只是操作本象的一个临时窗口。关掉对话、切换模型、清空上下文——世界还在。」 ——《愿景与定位》
七要素

对象

带稳定 ID 的真实实体——唯一能抓住的东西。

七要素

关系

谁拥有、谁引用、谁依赖、谁生成谁。

七要素

状态与时间

过去、现在、变化,以及每个变化的原因。

七要素

来源与证据

谁创建、谁修改、哪些是推断。

七要素

行为与约束

能做什么、不能违反什么——提交时强制执行。

七要素

领域载荷

各领域原生数据:几何、公式、时间线。

七要素

边界

这份表示保证不了什么。边界跟着包走,不是写在 README 里。

证据

状态追踪,实测——以及我们如实不主张什么Measured, and bounded

对外主张已按实验结果收窄到一个维度:状态追踪。考题:在 9.5 万字的长篇叙事里, 黑钥匙此刻在谁手里、谁知道了那个秘密、哪些伏笔还没收。

当前口径(A2 消融,2026-08-13)——请先看这段,再看下面那张旧表

只加一句提示词(A0→A2:要求模型显式维护状态)就带来 +41.3 pt 的状态准确率提升 (p = 3.3×10⁻⁵,显著)。在此之上再加全套机制——校验器、证据链、编译器(A2→A3)——只多带来 +2.5 pt,不显著(p = 0.47 / 0.72)。唯一幸存的分类性主张是结构性的: 提示词结构上产不出证据链。A3 对 15.0% / 27.5% 的受测字段给出可溯源证据, 所有纯提示词基线均为 0%。完整论证见 README §5 消融实验

ShadowBench-W · Run #27(2026-08-05)· 已被上方 A2 消融取代,作为历史记录留存,不再是当前口径 · qwen-plus · 9.5 万字 · 各 n=6
W3 状态准确率本象裸模型向量 RAG
得分95.8% ± 5.952.1% ± 19.758.3% ± 11.8
置换检验 vs 本象p = 0.0024p = 0.0024

先把不利的说在前面。字段级看,本象在 black-key.holder 上是 4/6,比两条对照臂的 5/6 都差——而那恰恰是唯一能从近文直接读出来的字段。 优势全部集中在两条对照臂同时近乎全灭的那两格:

字段裸模型RAG本象
black-key.holder(最后一次转交就写在自己正文里)5/65/64/6
bai-yao.secret_betrayal(跨几十章累积的秘密)1/60/66/6
hook:shen-yan-suspicion.status(从不存在于任何一段文字里)0/60/66/6
「能从自己刚写的正文里读出来的状态,检索和裸模型都够用,本象不占便宜; 需要跨全书累积、且从不在任何一段文字里被陈述的状态,只有状态机答得出来。」
臂内跨模型(Run #19,各 n=11)——跨模型主张中立住的那一半
qwen-plusdeepseek-v4-flash置换检验
W3 状态准确率98.9%98.9%均值差 0.0000 · p = 1.0000
W1 EPC(正文,越低越好)0.200.55均值差 −0.35 · p = 0.0392

状态层的正确性与底模无关,正文层的质量与底模显著相关。 这正是「协议」该有的性质:不依赖底下那台机器有多强。而且是 11 对 11——不是 n=1。

我们不主张什么

领域方言

一个外壳,多个本源通用外壳 + 领域方言

一个方言成功可能是巧合,两个才是协议。同一套核心,几乎零改动跑通四个域—— 领域知识进的是数据(约束表、条文库),不是代码。四个方言合计只给核心加了 4 行。

Memory

项目状态

聊天历史持续提交为世界状态,新会话秒恢复。MCP Server,零依赖。

Story

叙事

人物、秘密、伏笔、禁区,目标是百万字不失忆、事务式写作。

Law

判决依据链

引用白名单 + 量刑复算。自首减 55% 超出法定 40% 上限,当场拒绝,带依据。

xlsx

表格依赖链

公式依赖落在协议自带的 relations 上。「这个数由哪 10 个人工录入决定」——Excel 自己答不了。

四个方言在 AgentTeams 上共用同一条发证闸门——教材、CAD、小说换领域只换检查器,协议一行没改 →

一致性测试集——「协议」与「一个库」的分界线
向量
语言无关的测试向量(数据,不是代码)68 / 68
JavaScript 参考实现68 / 68
Python 第二实现(约 250 行,零依赖)60 / 60 core
参考实现第三方依赖0

任何实现只要写一个几十行的适配器就能当场自证合规—— 标准是那 68 条向量,不是「本象」这两个字。

为什么叫「协议」而不是「一个库」

一份实现自己跑通自己的测试,证明不了协议存在。变异检查故意打坏每一条协议承诺, 看抓得到——只被自测抓到的就是覆盖缺口。协议只保证向量钉住的部分。

最难的一场考试

白鼓挑战The White Drum Challenge

人类最长的长篇小说叫 Venmurasu(泰米尔语「白鼓」)——26 卷,约 22,400 页, 一个人,写了六年半。现在 AI 要挑战这个纪录,但我们给自己加了一个人类作者不需要面对的难度: 每一章的世界状态,都必须可验证。

现在

连载在跑

正在读取 stats.json…

下一步

10 万字

第一个公开里程碑

再然后

100 万字

百万字不失忆

目标

破 22,400 页

超越人类纪录,且全程可验证

drift-rate(模型记错前值率):上次实测 8.3%(2026-08-06;Run 编号未留存),非实时指标。 每章:正文 + 世界状态 + git 证据链。 看挑战规则 →

往哪里去

AI 时代的文件The origin package

如果这条路走通,AI 时代的「文件」不该再是 .docx.pdf, 而应该是一个本象包——能被打开、被看见、被定位、被修改、被复验。 人看投影,AI 改本象,系统证明改对了。

GitHub 上验证 读完整宣言