<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0"
  xmlns:atom="http://www.w3.org/2005/Atom"
  xmlns:content="http://purl.org/rss/1.0/modules/content/"
  xmlns:ap="https://www.grepcode.cn/ns/ai-papers">
  <channel>
    <title>TreeHeap 论文：概率下坠、多分辨率状态与生成协议 on GrepCode</title>
    <link>https://www.grepcode.cn/treeheap-paper.html</link>
    <description>Recent content in TreeHeap 论文：概率下坠、多分辨率状态与生成协议 on GrepCode</description>
    <image>
      <title>GrepCode</title>
      <url>https://www.grepcode.cn/img/treeheap-research-series.png</url>
      <link>https://www.grepcode.cn/img/treeheap-research-series.png</link>
    </image>
    <generator>Hugo</generator>
    <language>zh-CN</language>
    <lastBuildDate>Mon, 28 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://www.grepcode.cn/treeheap-paper/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>TreeHeap：概率下坠、多分辨率状态与可训练生成协议</title>
      <link>https://www.grepcode.cn/treeheap-paper/001-treeheap-emergent-protocol.html</link>
      <pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate>
      <ap:updated>Mon, 28 Sep 2026 00:00:00 +0000</ap:updated>
      <guid>https://www.grepcode.cn/treeheap-paper/001-treeheap-emergent-protocol.html</guid>
      <description>TreeHeap 当前完整理论与可计算教程：从概率背景场和 token 下坠出发，用 toy、LaTeX 定义和有限证明解释局部主轴、Monte Carlo、FOLD、READ、Decoder、私有协议、证据边界与研发路线。</description>
      <content:encoded><![CDATA[<p><strong>English title:</strong> <em>TreeHeap: Probabilistic Falling, Multiresolution States, and a Trainable Generative Protocol</em></p>
<p><strong>状态：</strong> 当前理论整合稿 v0.8，2026-09-28\</p>
<p><strong>作者：</strong> Houming818（Independent Researcher）</p>
<p><strong>研究协作：</strong> Houming818 与 Trinity（Codex）</p>
<p><strong>代码与证据：</strong> SameTime / ARA，GPL-3.0</p>
<p><strong>阅读方式：</strong> 本文维护当前理论全貌。数字编号的 <a href="/spr/">SPR 系列</a> 保存研究过程、失败实验与证据演化；旧结论只在解释当前设计或证据边界时作为 reference 引入。</p>
<h2 id="摘要">摘要</h2>
<p>TreeHeap 研究一种不同于“先随机放置 token 向量，再交给多层网络变换”的表示路径：先从语料统计每个 token 的条件背景分布，再让 token 从 TreeHeap 的 root 开始，以局部概率决策逐层下坠，最终形成 leaf 概率、路径概率和多分辨率节点质量。Embedding 因而不是一张先验给定的地址表，而是 token 与已有背景场相互作用后形成的结构化概率状态。</p>
<p>在当前算法中，token <code>t</code> 首先由上下文统计得到 <code>p(c|t)</code>，并使用与 Hellinger 几何相容的平方根坐标。每个内部节点拥有局部观察轴、阈值和温度，计算左右分支概率。全部节点函数组成整树映射；Monte Carlo、梯度下降和拓扑搜索则是寻找节点参数的学习算法，不是映射本身。节点以概率质量加权形成 context prototype，child 与 parent 的差构成可审计残差。该结构已经能够被搜索、保存、重载和分层读取，但尚未证明自己是最终语义空间。</p>
<p>完整生成架构还要求解决更困难的问题：把 token type 的背景坐标变成句中 occurrence 状态；设计一个在相同状态族中闭合、同时又能区分 <code>AB</code> 与 <code>BA</code> 的序列 FOLD；让 READ 根据生成 query 选择 coarse 或 fine 状态；最后由 Decoder 形成输出分布。我们当前采用“coarse 较稳定、fine 保留更多未决可能性”的概率性假设，并明确区分表征中的不确定性与 Decoder sampling 产生的不确定性。</p>
<p>现有证据支持一个有限结论：概率背景场可以在 TreeHeap 中形成非随机、可重载、含有预测信息的多分辨率划分；局部路由既可以由 Monte Carlo 搜索，也可以由梯度更新；更深状态在登记实验中保留了更多背景预测信息。现有证据不支持：已经找到唯一 F、已经完成保序序列 Encoder、已经形成完整 Encoder/Decoder 私有协议，或已经获得优于 Transformer 的产品质量和计算优势。</p>
<p>因此，TreeHeap 当前不是完成品，也不是只有类比的设想。它已经收敛为一个可逐项实现和反驳的架构任务：以概率下坠建立表示，以闭合且保序的 FOLD 建立句子状态，以分辨率感知 READ 连接 Decoder，并在消费级 GPU 上完成可恢复的端到端训练。</p>
<p><img alt="TreeHeap 当前端到端架构：绿色是已有有限证据，橙色是核心算法缺口，蓝色是待接通模块" decoding="async" loading="eager" src="/images/treeheap-paper/end-to-end-map.svg"></p>
<h2 id="0-先用一个最小-toy-看懂全链路">0. 先用一个最小 toy 看懂全链路</h2>
<p>这一节先不讨论大模型。我们只使用 4 个 token、4 个上下文维度和一棵深度为 2 的二叉树。它的目的不是证明 TreeHeap 已经理解语言，而是让后文每个符号都有一个可以手算的对象。</p>
<h3 id="01-toy-语料与概率背景">0.1 Toy 语料与概率背景</h3>
<p>假设词表中只有：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>苹果 apple    梨 pear    汽车 car    公交车 bus
</span></span></code></pre></div><p>我们只观察四类上下文：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>甜 sweet    吃 eat    行驶 drive    道路 road
</span></span></code></pre></div><p>计数并归一化后，得到条件概率表：</p>
<table>
  <thead>
      <tr>
          <th>token</th>
          <th style="text-align: right">sweet</th>
          <th style="text-align: right">eat</th>
          <th style="text-align: right">drive</th>
          <th style="text-align: right">road</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>apple</td>
          <td style="text-align: right">0.50</td>
          <td style="text-align: right">0.40</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.05</td>
      </tr>
      <tr>
          <td>pear</td>
          <td style="text-align: right">0.45</td>
          <td style="text-align: right">0.45</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.05</td>
      </tr>
      <tr>
          <td>car</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.50</td>
          <td style="text-align: right">0.40</td>
      </tr>
      <tr>
          <td>bus</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.05</td>
          <td style="text-align: right">0.40</td>
          <td style="text-align: right">0.50</td>
      </tr>
  </tbody>
</table>
<p>于是 apple 的背景状态是：</p>
$$
p_{\text{apple}}=(0.50,\,0.40,\,0.05,\,0.05),
\qquad \sum_{k=1}^{4}p_{\text{apple},k}=1.
$$<p>这里的坐标不是“apple 本身的全部意义”，而是语料给出的四个条件概率。pear 与 apple 接近，car 与 bus 接近，这是语料统计产生的，不是我们先写进 token ID 的。</p>
<p>为了在概率分布之间使用具有统计含义的欧氏几何，令：</p>
$$
x_t=\sqrt{p_t}
=\left(\sqrt{p_{t,1}},\ldots,\sqrt{p_{t,K}}\right).
$$<p>两个 token 的 Hellinger 距离为：</p>
$$
H(p,q)=\frac{1}{\sqrt 2}\lVert \sqrt p-\sqrt q\rVert_2.
$$<p>因此，在平方根坐标中做欧氏距离计算，并不是随意选择一种向量技巧；它等价于比较两个离散概率分布的 Hellinger 距离。</p>
<h3 id="02-toy-tree每个节点问一个局部问题">0.2 Toy Tree：每个节点问一个局部问题</h3>
<p>设 root 的观察轴为：</p>
$$
w_0=(1,1,-1,-1), \qquad b_0=0.
$$<p>它大致在问：“这个 token 更像食物上下文，还是交通上下文？”节点分数和右路由概率定义为：</p>
$$
z_0(t)=x_t^{\mathsf T}w_0-b_0,
\qquad
g_0(t)=\sigma\!\left(\frac{z_0(t)}{\tau_0}\right),
$$<p>其中：</p>
$$
\sigma(u)=\frac{1}{1+e^{-u}}.
$$<p><code>g=0.5</code> 表示节点暂时不能区分两侧，<code>g</code> 接近 0 或 1 表示路由更确定。它不是 token 的最终输出概率，只是这个节点的局部分支概率。</p>
<p>第二层使用不同的观察轴。例如，左子树可以比较 <code>sweet</code> 与 <code>eat</code>，右子树可以比较 <code>drive</code> 与 <code>road</code>：</p>
$$
w_L=(1,-1,0,0),
\qquad
w_R=(0,0,1,-1).
$$<p>这就是“局部主轴”的最小含义：不同节点面对的候选集合不同，因此允许提出不同的分类问题。若所有节点共享完全相同的轴，深树可能只会反复回答同一个问题。</p>
<h3 id="03-一次软下坠怎样得到-4-个-leaf">0.3 一次软下坠怎样得到 4 个 leaf</h3>
<p>为了便于手算，假设某个 token 在 root 的右路由概率是 <code>0.8</code>；到左子节点时右路由概率是 <code>0.25</code>；到右子节点时右路由概率是 <code>0.75</code>。从 root 的单位质量开始：</p>
$$
m_{\varnothing}(t)=1.
$$<p>每经过一个节点，质量按概率分裂：</p>
$$
m_{vL}(t)=m_v(t)\bigl(1-g_v(t)\bigr),
\qquad
m_{vR}(t)=m_v(t)g_v(t).
$$<p>深度 2 的四个 leaf 质量为：</p>
$$
\begin{aligned}
m_{LL}&=(1-0.8)(1-0.25)=0.15,\\
m_{LR}&=(1-0.8)(0.25)=0.05,\\
m_{RL}&=(0.8)(1-0.75)=0.20,\\
m_{RR}&=(0.8)(0.75)=0.60.
\end{aligned}
$$<p>因此 token 的 soft leaf Embedding 是：</p>
$$
e_t=(0.15,\,0.05,\,0.20,\,0.60)\in\Delta^3.
$$<p>它不是“选中一个地址就结束”。它保留了 token 对全部 leaf 的概率质量。hard routing 则取最大路径，在本例中落到 <code>RR</code>；soft routing 保留了“主要在 RR，但仍有其他可能”的状态。</p>
<p><img alt="深度二概率下坠 toy：单位质量按局部条件概率分裂为四个 leaf" decoding="async" loading="eager" src="/images/treeheap-paper/toy-probability-fall.svg"></p>
<h3 id="04-命题一下坠质量守恒">0.4 命题一：下坠质量守恒</h3>
<p><strong>命题。</strong> 若 root 质量为 1，且每个节点都按 <code>g</code> 与 <code>1-g</code> 分配质量，其中 $g\in[0,1]$，则任意深度 $d$ 的全部节点质量之和均为 1。</p>
<p><strong>证明。</strong> 深度 0 时只有 root，因此总质量为 1。假设深度 $d$ 的总质量为：</p>
$$
\sum_{v\in V_d}m_v=1.
$$<p>每个 $v$ 在下一层产生两个 child，且：</p>
$$
m_{vL}+m_{vR}
=m_v(1-g_v)+m_vg_v
=m_v.
$$<p>于是：</p>
$$
\sum_{u\in V_{d+1}}m_u
=\sum_{v\in V_d}(m_{vL}+m_{vR})
=\sum_{v\in V_d}m_v
=1.
$$<p>由数学归纳法，对任意有限深度成立。$\square$</p>
<p>这个证明只说明数值质量不会凭空增加或消失。它<strong>没有证明语义守恒</strong>，也没有证明这种路由优于其他 Embedding。</p>
<h3 id="05-多分辨率状态到底是什么">0.5 多分辨率状态到底是什么</h3>
<p>深度 0 只有一个 root 质量：</p>
$$
m^{(0)}=(1).
$$<p>深度 1 有两个 coarse 区域：</p>
$$
m^{(1)}=(0.20,\,0.80).
$$<p>深度 2 有四个 fine 区域：</p>
$$
m^{(2)}=(0.15,\,0.05,\,0.20,\,0.60).
$$<p>这里“多分辨率”不是把一个 float 放大或缩小。它是同一单位质量在不同分区粒度上的边缘分布，并满足：</p>
$$
m_v=m_{vL}+m_{vR}.
$$<p>所以 coarse 可以由 fine 精确求和得到；但只知道 coarse 的 <code>0.20</code>，不能唯一恢复它原来是 <code>(0.15,0.05)</code>、<code>(0.10,0.10)</code>，还是其他组合。低分辨率到高分辨率天然是一对多问题。</p>
<p><img alt="同一状态在 root、coarse 与 fine 层的概率表示，以及 query 条件 READ" decoding="async" loading="eager" src="/images/treeheap-paper/coarse-fine-read.svg"></p>
<h3 id="06-命题二概率-parent-仍在同一个单纯形">0.6 命题二：概率 parent 仍在同一个单纯形</h3>
<p>设两个 child 的背景概率分别为 $p_L,p_R\in\Delta^{K-1}$，质量为 $m_L,m_R\ge 0$。定义 parent prototype：</p>
$$
p_P=\frac{m_Lp_L+m_Rp_R}{m_L+m_R},
\qquad m_L+m_R>0.
$$<p><strong>命题。</strong> $p_P\in\Delta^{K-1}$。</p>
<p><strong>证明。</strong> 因为 $p_L,p_R$ 各维非负，$p_P$ 各维也非负；并且：</p>
$$
\sum_{k=1}^{K}p_{P,k}
=\frac{m_L\sum_kp_{L,k}+m_R\sum_kp_{R,k}}{m_L+m_R}
=\frac{m_L+m_R}{m_L+m_R}=1.
$$<p>因此 parent 与 child 仍是同一种概率数据类型。$\square$</p>
<p>这就是当前“量纲自洽”的最低数学地基。它仍未解决顺序，也不能保证 parent 对生成任务足够。</p>
<h3 id="07-残差能恢复什么不能恢复什么">0.7 残差能恢复什么，不能恢复什么</h3>
<p>定义：</p>
$$
r_L=p_L-p_P,
\qquad
r_R=p_R-p_P.
$$<p>只要保存 $p_P,r_L,r_R$，就有：</p>
$$
p_L=p_P+r_L,
\qquad
p_R=p_P+r_R.
$$<p>这是代数上的精确恢复。然而，如果只保留 $p_P$ 而丢弃残差，就不能恢复两个 child。更重要的是，<code>可恢复 child 概率</code> 不等于 <code>可以生成原句</code>：原句还包含顺序、位置、上下文角色和 Decoder 协议。</p>
<h3 id="08-命题三对称平均不可能表达词序">0.8 命题三：对称平均不可能表达词序</h3>
<p>若序列 FOLD 仅使用对称加权平均：</p>
$$
F(a,b)=\frac{m_ap_a+m_bp_b}{m_a+m_b},
$$<p>则交换输入后：</p>
$$
F(b,a)=\frac{m_bp_b+m_ap_a}{m_b+m_a}=F(a,b).
$$<p>因此它不能区分 <code>AB</code> 与 <code>BA</code>。这不是训练不够，而是函数本身具有交换性。若任务要求区分“狗咬人”和“人咬狗”，FOLD 至少必须引入位置、角色、非交换算子或有方向的残差。</p>
<p>这个结论解释了为什么“概率 Embedding 已经形成”并不等于“序列 Encoder 已经完成”。</p>
<h3 id="09-monte-carlo-在搜索什么">0.9 Monte Carlo 在搜索什么</h3>
<p>令整棵树参数为：</p>
$$
\Theta=\{w_v,b_v,\tau_v\}_{v\in\mathcal V}.
$$<p>给定一个可计算目标 $J(\Theta)$，例如邻域保持、负载均衡、masked context 预测和复杂度惩罚的组合：</p>
$$
J(\Theta)
=\lambda_1J_{\text{neighbor}}
+\lambda_2J_{\text{balance}}
+\lambda_3J_{\text{masked}}
+\lambda_4J_{\text{complexity}}.
$$<p>一次 Monte Carlo 提议可以只扰动一个节点：</p>
$$
\Theta'=\Theta+\varepsilon,
\qquad
\varepsilon_v\sim\mathcal N(0,\sigma^2I).
$$<p>模拟退火式接受概率为：</p>
$$
P(\Theta\rightarrow\Theta')
=\min\left(1,
\exp\left[-\frac{J(\Theta')-J(\Theta)}{T}\right]
\right).
$$<p>若新参数更好，必然接受；若更差，仍可能以随温度 $T$ 降低的概率接受，从而避免立即困在局部极值。这里得到的是<strong>搜索算法</strong>，不是 TreeHeap 正确性的证明。它只能回答：“在给定状态、算子集合和目标函数下，能否找到通过门禁的参数？”</p>
<h3 id="010-toy-read-与-decoder-怎样接上">0.10 Toy READ 与 Decoder 怎样接上</h3>
<p>假设一句话经过 Encoder/FOLD 后，在三个分辨率得到状态：</p>
$$
h^{(0)}\in\mathbb R^d,
\qquad
h^{(1)}\in\mathbb R^d,
\qquad
h^{(2)}\in\mathbb R^d.
$$<p>Decoder 在第 $j$ 个生成位置持有 query $q_j$。一个最小的分辨率 READ 可以先计算：</p>
$$
a_{j,d}
=\frac{\exp\!\left(q_j^{\mathsf T}W_Rh^{(d)}\right)}
{\sum_{r=0}^{D}\exp\!\left(q_j^{\mathsf T}W_Rh^{(r)}\right)},
$$<p>再读出：</p>
$$
r_j=\sum_{d=0}^{D}a_{j,d}h^{(d)}.
$$<p>若当前正在决定句子主题，模型可能给 coarse 层更大权重；若正在决定具体名词或词尾，可能给 fine 层更大权重。这是待训练和审计的行为，不是人工规定的语言规律。</p>
<p>Decoder 把读出状态映射到词表 logits：</p>
$$
\ell_j=W_Dr_j+b_D,
\qquad
P(y_j=k\mid y_{\lt j},x)
=\frac{e^{\ell_{j,k}}}{\sum_{u\in\mathcal V}e^{\ell_{j,u}}}.
$$<p>如果目标 token 为 $y_j^*$，交叉熵为：</p>
$$
\mathcal L_j=-\log P(y_j^*\mid y_{\lt j},x).
$$<p>只要路由、FOLD、READ 和 Decoder 都处在同一个可微计算图中，链式法则给出：</p>
$$
\frac{\partial\mathcal L_j}{\partial\theta_v}
=\frac{\partial\mathcal L_j}{\partial\ell_j}
\frac{\partial\ell_j}{\partial r_j}
\frac{\partial r_j}{\partial h^{(d)}}
\frac{\partial h^{(d)}}{\partial\theta_v}.
$$<p>这说明“不共享参数”不等于“不能形成协议”。READ 参数与 Encoder 参数可以不同，但同一个 loss 会同时约束双方。是否真的形成了私有协议，还必须用输入置乱、层级消融、旁路检查和 checkpoint 重载来验证。</p>
<h3 id="011-从-toy-到真实系统还缺哪三步">0.11 从 toy 到真实系统，还缺哪三步</h3>
<p>这个 toy 已经解释了：</p>
<ol>
<li>语料怎样形成概率背景坐标；</li>
<li>节点怎样把单位质量逐层下坠；</li>
<li>parent 怎样保持概率类型，残差怎样保留 detail。</li>
</ol>
<p>它还没有解释：</p>
<ol>
<li>同一个 <code>bank</code> 在不同句中怎样得到不同 occurrence state；</li>
<li><code>AB</code> 怎样在不丢失必要顺序的条件下 FOLD；</li>
<li>Decoder 怎样从 coarse/fine 状态生成多个连续 token。</li>
</ol>
<p>后文的架构正是为了逐项补上这三处断点。读到任何公式时，都可以回到这个 toy，确认它在处理的是背景概率、路由质量、序列状态，还是输出分布。</p>
<h2 id="1-研究问题">1. 研究问题</h2>
<h3 id="11-为什么不把-treeheap-简化为树形神经网络">1.1 为什么不把 TreeHeap 简化为“树形神经网络”</h3>
<p>树形状本身只提供地址、父子关系、路径和递归深度。它不会自动提供语义，也不会因为 root 覆盖更多 leaf，就自动成为一句话的摘要。</p>
<p>TreeHeap 真正研究的是四个相互依赖的问题：</p>
<ol>
<li><strong>表示从哪里来：</strong> token 怎样从语料观测形成可计算坐标，而不是被随机摆放？</li>
<li><strong>分辨率是什么：</strong> root、parent、leaf 怎样表示同一对象的不同分辨率，而不是不同类型的杂乱张量？</li>
<li><strong>组合怎样发生：</strong> 两个有顺序的状态怎样形成 parent，同时保留目标任务需要的信息？</li>
<li><strong>状态怎样被消费：</strong> READ 和 Decoder 怎样通过训练学会使用这些状态，而不是绕过 TreeHeap？</li>
</ol>
<h3 id="12-核心研究假设">1.2 核心研究假设</h3>
<p>当前理论由五个可被修改的假设组成。</p>
<p><strong>假设 H1：概率背景假设。</strong> token 的意义至少部分表现为它对上下文候选空间施加的概率约束。</p>
<p><strong>假设 H2：下坠构造假设。</strong> 一个 token 的 Embedding 可以由 root-to-leaf 的局部条件决策构造，而不是必须先给出一个任意向量。</p>
<p><strong>假设 H3：多分辨率不确定性假设。</strong> coarse 状态保存较稳定的共同约束，fine 状态保留更多局部差异和未决可能性。</p>
<p><strong>假设 H4：同状态族闭合假设。</strong> Embedding、FOLD 与 READ 若处理同一个多分辨率对象，其输入输出应保持明确的数据类型、概率归一化和量纲合同。</p>
<p><strong>假设 H5：私有协议假设。</strong> Encoder、READ 和 Decoder 不必共享参数，但可以通过端到端梯度形成一套共同使用的内部表示规则。</p>
<p>本文不会把这些假设写成自然定律。每个假设都需要独立的算法和反证条件。</p>
<h3 id="13-当前目标不是历史路线">1.3 当前目标，不是历史路线</h3>
<p>本文主线是当前目标架构：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>corpus observations
</span></span><span style="display:flex;"><span>  -&gt; token background field
</span></span><span style="display:flex;"><span>  -&gt; root-to-leaf probabilistic Embedding / UNFOLD
</span></span><span style="display:flex;"><span>  -&gt; occurrence state with order and context
</span></span><span style="display:flex;"><span>  -&gt; same-state-family sequence FOLD
</span></span><span style="display:flex;"><span>  -&gt; multiresolution TreeState
</span></span><span style="display:flex;"><span>  -&gt; resolution-aware READ
</span></span><span style="display:flex;"><span>  -&gt; Decoder distribution
</span></span><span style="display:flex;"><span>  -&gt; generated sequence
</span></span></code></pre></div><p>过去的 ID 路由、随机角色基、可逆 Lifting、XOR-Butterfly、STOP gate 和 WMT 翻译 checkpoint，只在它们对当前合同仍有解释力时作为 reference。它们不再单独定义理论路线。</p>
<h2 id="2-数据对象从-token-到概率背景场">2. 数据对象：从 token 到概率背景场</h2>
<h3 id="21-token-id-不是语义坐标">2.1 Token ID 不是语义坐标</h3>
<p>token ID 是词表索引。编号 100 与 101 相邻，不代表两个 token 在语言中更接近。直接对 ID 做加减、Hash 或二进制分路，可以得到稳定地址，却不能自动得到语义关系。</p>
<p>还必须区分两种对象：</p>
<ul>
<li><code>token type</code>：词表中的抽象单位，例如 <code>bank</code>；</li>
<li><code>token occurrence</code>：某一句、某个位置实际出现的 <code>bank</code>。</li>
</ul>
<p>背景 Embedding 首先组织 type。句子 Encoder 必须在此基础上构造 occurrence，否则一词多义、顺序、指代和组合语义都没有进入状态。</p>
<h3 id="22-条件背景分布">2.2 条件背景分布</h3>
<p>从语料统计 token <code>t</code> 周围 context <code>c</code> 的出现次数，经平滑和归一化得到：</p>
$$
p_t(c)=P(\mathrm{context}=c\mid \mathrm{token}=t).
$$<p>因此一个 token 的基础观测不是整数，而是一行概率：</p>
$$
p_t=\left[P(c_1\mid t),P(c_2\mid t),\ldots,P(c_K\mid t)\right],
\qquad p_t[k]\ge 0,
\qquad \sum_{k=1}^{K}p_t[k]=1.
$$<p>所有 token 行位于同一个概率单纯形中，具有相同维度和单位。它描述的是分布式上下文，不是完整语义，也不是句子 hidden state。</p>
<h3 id="23-平方根概率坐标">2.3 平方根概率坐标</h3>
<p>路由使用：</p>
$$
x_t=\sqrt{p_t}.
$$<p>逐维开平方后，欧氏距离与 Hellinger 距离相容。这样，两个条件分布之间的几何距离有明确概率含义，避免直接在 token ID 或任意随机坐标上寻找主轴。</p>
<h3 id="24-背景场">2.4 背景场</h3>
<p>所有 <code>p_t</code>、节点统计、路径和原型共同组成当前的背景场。它记录语料中的共现规律，可以作为新 token 下坠时的参考系。</p>
<p>背景场目前不能被称为完整世界模型。它没有直接证明因果、物理规律、句法或长期记忆；它只是可复现的语料条件概率结构。</p>
<h2 id="3-embeddingroot-to-leaf-概率下坠">3. Embedding：root-to-leaf 概率下坠</h2>
<h3 id="31-节点函数">3.1 节点函数</h3>
<p>TreeHeap 的每个内部节点 <code>v</code> 拥有局部参数：</p>
$$
\theta_v=\{w_v,b_v,\tau_v\}.
$$<p>其中 <code>w_v</code> 是局部观察轴，<code>b_v</code> 是阈值，<code>tau_v</code> 是温度。节点先计算：</p>
$$
z_v(t)=x_t^{\mathsf T}w_v-b_v.
$$<p>硬路由为：</p>
$$
z_v(t)\le 0\Rightarrow \mathrm{left},
\qquad
z_v(t)>0\Rightarrow \mathrm{right}.
$$<p>软路由保留两侧概率：</p>
$$
g_v(t)=P(\mathrm{right}\mid t,v)
=\sigma\!\left(\frac{z_v(t)}{\tau_v}\right).
$$<h3 id="32-质量下坠">3.2 质量下坠</h3>
<p>token 从 root 携带单位质量开始：</p>
$$
m_{\mathrm{root}}(t)=1.
$$<p>在节点 <code>v</code>：</p>
$$
m_{vL}(t)=m_v(t)\bigl(1-g_v(t)\bigr),
\qquad
m_{vR}(t)=m_v(t)g_v(t).
$$<p>递归到全部 leaf 后，质量仍满足：</p>
$$
\sum_{\ell\in\mathrm{Leaves}}m_\ell(t)=1.
$$<p>于是 token 的 leaf Embedding 为：</p>
$$
e_t=\left[m_{\ell_1}(t),\ldots,m_{\ell_L}(t)\right].
$$<p>它既是一行概率，也是一组局部条件决策的乘积。对任意深度，把后代 leaf 质量相加，就得到该深度的节点概率。因此，一次下坠同时产生 leaf 坐标、路径坐标和多分辨率坐标。</p>
<h3 id="33-局部主轴为什么必须因节点而异">3.3 局部主轴为什么必须因节点而异</h3>
<p>所有节点共享同一种计算规则，但不应强制共享同一组 <code>w_v,b_v</code>。root 观察全局数据，child 只观察已经经过上游筛选的子群。每个节点重新计算或学习局部主轴，整棵树才形成分段的层级划分，而不是反复使用同一个超平面。</p>
<p>局部主轴当前优化的是背景重建或下游目标。不能仅凭轴存在，就把某一维命名为“主语”“生命”或其他人类语义特征。</p>
<h3 id="34-背景先形成新-token-再安装">3.4 背景先形成，新 token 再安装</h3>
<p>已安装 token 在节点中形成质量、context prototype 和占用统计。新 token 到达时：</p>
<ol>
<li>读取当前节点的局部统计；</li>
<li>计算左右分支概率；</li>
<li>将质量递归传播到后代；</li>
<li>用新观测更新经过节点的统计。</li>
</ol>
<p>这构成 token 与背景场的双向关系：背景影响新 token 路径，新 token 又改变背景。</p>
<p>高频 token 先安装可以提高早期统计稳定性，但历史实验也表明，它可能损害分支利用率和预测质量。因此“频率优先”只是候选初始化策略，不是理论必需条件。</p>
<h3 id="35-防拥挤与互斥压力">3.5 防拥挤与互斥压力</h3>
<p>只有相似性吸引时，大量 token 可能进入少数分支。候选目标可以加入：</p>
<ul>
<li>节点左右占用平衡；</li>
<li>leaf 有效数量；</li>
<li>路由熵或容量惩罚；</li>
<li>正样本吸引与负样本排斥；</li>
<li>随深度变化的相似性和容量压力。</li>
</ul>
<p>这些约束的职责是防止路径坍缩，而不是人工规定每个节点必须五五分流。当前没有一个已经被证明普适的互斥公式。</p>
<h3 id="36-动态词表与渐进单位">3.6 动态词表与渐进单位</h3>
<p>理想情况下，基础 token、复合 token、短语和新词可以在同一背景场中依次安装，而不是各自建立无关空间。新单位读取已有背景后下坠，并在不立即扩展树深的情况下获得坐标。</p>
<p>目前仍未解决：新增 token 后怎样更新局部轴和原型，同时保证旧 token 路径不过度漂移。</p>
<h2 id="4-f整树映射与学习算法">4. F、整树映射与学习算法</h2>
<h3 id="41-术语合同数据结构运算与扩容">4.1 术语合同：数据、结构、运算与扩容</h3>
<p>历史讨论曾把“词的统计背景”“树上的位置”“FOLD 运算”和“参数搜索”混在一起，并把多种对象都简称为 F。后续论证统一使用下面的名称。</p>
<h4 id="411-数据对象">4.1.1 数据对象</h4>
<p><strong>基础输出字母表（base output alphabet）</strong> $\Sigma$ 是 tokenizer 直接产生、Decoder 最终输出的基础 token 集。在一个实验版本内，$\Sigma$ 可以保持固定。</p>
<p><strong>多元组（n-gram）</strong> 是语料中连续或按注册关系组合的 token 序列：</p>
$$
g=(x_1,x_2,\ldots,x_n)\in\Sigma^*.
$$<p>多元组的一次出现只是一个训练事件，并不自动成为新词。</p>
<p><strong>注册语言单位（registered unit）</strong> 是通过频率、预测增益和稳定性门禁后，被允许拥有独立统计量和 TreeHeap 坐标的对象。它可以是基础 token、复合词或短语，统一记为 $u$。</p>
<p><strong>动态内部语言单位集（internal unit vocabulary）</strong> $U_t$ 是时刻 $t$ 已注册到 TreeHeap 的全部语言单位：</p>
$$
U_t=\{u_1,u_2,\ldots,u_m\}.
$$<p>因此，“观察到二元组”和“内部词表新增一个二元单位”不是同一件事。只有执行注册操作 $U_{t+1}=U_t\cup\{g\}$，TreeHeap 的内部语言单位才真正扩大。$\Sigma$ 可以保持不变。</p>
<p><strong>context 基（context basis）</strong> 是描述单位周围统计环境的坐标集合，记为 $C$。单位 $u$ 在该基上的条件概率行为写为：</p>
$$
p_u(c)=P(c\mid u),\qquad c\in C.
$$<p><strong>背景场（background field）</strong> 不是一个额外的大向量，也不是内部词表的别名。它是输出字母表、内部单位集、先验、条件概率行及其 TreeHeap 聚合状态构成的版本化统计系统：</p>
$$
\mathcal B_t=\left(\Sigma,U_t,C_t,\{P(u)\}_{u\in U_t},\{p_u\}_{u\in U_t},G_t,\{p_v\}_{v\in G_t}\right).
$$<p>新增共现样本可以只更新固定单位集上的背景参数；只有新单位通过注册门禁时才扩充 $U_t$。前者不能被称为新概念形成。</p>
<p>内部单位不必直接进入基础 tokenizer。READ 若选择复合单位 $u$，可以通过确定性展开映射回基础输出序列：</p>
$$
\operatorname{spell}:U_t\longrightarrow\Sigma^*.
$$<h4 id="412-树结构">4.1.2 树结构</h4>
<p><strong>节点（node）</strong> 是 TreeHeap 中保存质量、prototype 或残差状态的位置，记为 $v$。<code>leaf</code> 是最细粒度注册单位的落点，<code>parent</code> 是一个或多个 child 经 FOLD 后形成的组合状态，<code>root</code> 是当前树的最粗粒度状态。</p>
<p><strong>地址（address）</strong> 是节点在固定拓扑中的静态坐标，例如深度和左右分支序列：</p>
$$
a(v)=(d,b_1,b_2,\ldots,b_d),\qquad b_i\in\{L,R\}.
$$<p><strong>路由（route）</strong> 是某个单位在各节点上作出的分支选择。地址描述“节点在哪里”，路由描述“单位选择了哪条分支”。在简单二叉树中二者可以写成相同的 <code>L/R</code> 序列，但概念不同。</p>
<p><strong>递归路径（recursive path）</strong> 是从 root 到目标状态实际经历的节点函数、中间状态和残差序列。它包含计算历史：</p>
$$
\pi(u)=\big[(v_0,h_0),(f_{v_0},r_0),\ldots,(v_d,h_d)\big].
$$<p>两个单位可以到达同一静态地址，却因软路由权重、节点参数或中间状态不同而具有不同递归路径。因此，证明 address 有效不自动证明 recursive path 具有独立因果性。</p>
<p><strong>节点 prototype</strong> $p_v$ 是节点内注册单位条件概率行的质量加权聚合；<strong>detail/residual</strong> $\delta_v$ 是 child 相对 parent 未被粗粒度状态解释的差异。第五节给出它们的正式定义。</p>
<h4 id="413-运算符">4.1.3 运算符</h4>
<p><strong>节点函数</strong>：</p>
$$
f_v(x;\theta_v).
$$<p>它在单个节点上计算局部路由、状态变换或残差分配。</p>
<p><strong>整树映射 F</strong>：</p>
$$
F_{G,\Theta}=\mathop{\mathrm{Compose}}_{v\in\mathcal V(G)}f_v(\,\cdot\,;\theta_v).
$$<p>它在给定拓扑 $G$ 上组合所有节点函数，把输入映射为 route、leaf 坐标和多层状态。$\Theta$ 是节点参数集合。本文所说的“搜索 F”，主要指寻找合适的函数族、拓扑和参数，而不是搜索一个单独标量公式。</p>
<p><strong>FOLD</strong> 是把 child 状态组合成 parent，并按协议产生或保留 detail 的局部运算。<strong>UNFOLD</strong> 是利用 parent、detail 和 address 恢复下一层状态的闭合运算。FOLD/UNFOLD 回答“递归状态是否保存信息”。</p>
<p><strong>READ</strong> 根据 query 和读取预算，从一个或多个层级取出任务状态。<strong>Decoder</strong> 把 READ 状态转换为输出 token 分布。READ/Decoder 回答“已保存的信息能否支持具体任务”。数值闭合、有效 READ 和语言生成是三个不同的 Claim。</p>
<p><strong>学习算法 A</strong>：</p>
$$
\mathcal A(D,F_{G,\Theta})\longrightarrow(G',\Theta').
$$<p>它根据数据 $D$ 搜索或训练拓扑与参数。Monte Carlo、梯度下降和拓扑搜索属于 $\mathcal A$，不属于 $F_{G,\Theta}$ 本身。一次搜索失败不等于整个 F 函数族错误；一个 F 可微，也不表示当前 loss 能找到有用参数。</p>
<h4 id="414-三种扩容动作">4.1.4 三种扩容动作</h4>
<p><strong>内部语言单位扩容</strong> 是注册新的语言单位：</p>
$$
U_{t+1}=U_t\cup G_{\mathrm{accepted}}.
$$<p><strong>背景参数更新</strong> 是在 $U_t$ 不变时，用新样本更新已有 $P(u)$、$P(c\mid u)$、节点质量和沿途 prototype/residual。它可以持续改善已有单位，但不能产生新的复合语言单位。</p>
<p><strong>背景场扩容</strong> 要求至少增加新的注册单位及其概率行、TreeHeap route 和 <code>spell</code> 规则。若只改变旧概率表，应称为参数更新，而不是背景场扩容。</p>
<p><strong>拓扑扩容</strong> 是在节点容量、冲突率或读取误差越过门槛后执行分裂或加深：</p>
$$
G\longrightarrow G'.
$$<p>内部单位扩大不要求整棵树立即加深；背景参数更新也不等于新增节点。工程上应优先做沿 route 的局部统计更新，只有局部容量不足时才改变拓扑。这样才能分别测量：新增的是语言单位、统计信息，还是结构容量。</p>
<h3 id="42-monte-carlo-搜索硬树">4.2 Monte Carlo 搜索硬树</h3>
<p>硬树的 Monte Carlo 搜索固定深度和状态定义，反复执行：</p>
<ol>
<li>随机选择一个节点；</li>
<li>对其观察轴或阈值提出局部扰动；</li>
<li>让受影响 token 重新下坠；</li>
<li>重新计算节点原型；</li>
<li>在封存的 dev 共现数据上计算重建 NLL；</li>
<li>接受更优方案，并以退火概率接受少量更差方案。</li>
</ol>
<p>设新旧目标差为：</p>
$$
\Delta J=J_{\mathrm{new}}-J_{\mathrm{old}}.
$$<p>一个典型接受规则是：</p>
$$
P(\mathrm{accept})=
\begin{cases}
1, & \Delta J\le 0,\\
\exp(-\Delta J/T), & \Delta J>0.
\end{cases}
$$<p>温度 <code>T</code> 随搜索降低。该方法的优点是路径、节点与概率守恒都能直接审计；缺点是高维提案效率较低，离散重路由也不能直接利用梯度方向。</p>
<p>搜索目标当前主要是未见背景 context 的重建 NLL。它优化的是 token 分区几何，不是一般句子组合公式。</p>
<h3 id="43-梯度训练软树">4.3 梯度训练软树</h3>
<p>软路由保留全部路径概率，loss 可以对 <code>w_v,b_v,tau_v</code> 求导。这样，普通优化器能够更新节点轴和阈值，也可以接收 READ 或 Decoder 的下游梯度。</p>
<p>软树的主要风险是训练与部署不一致。训练时多个路径共同承载信息，若结束后突然以 <code>0.5</code> 阈值硬化，混合状态会被切断。当前理论因此不要求立刻硬化，而是先建立软模型的应用门，再研究 Top-k、稀疏概率和 soft/hard 一致性训练。</p>
<h3 id="44-拓扑与参数联合搜索">4.4 拓扑与参数联合搜索</h3>
<p>节点参数是连续变量，父子连接和组合顺序是离散变量。若同时搜索二者，问题成为混合优化：</p>
$$
\min_{G,\Theta}
\left[
\mathcal L_{\mathrm{task}}(F_{G,\Theta})
+\lambda\,C_{\mathrm{structure}}(G,\Theta)
\right].
$$<p>人工比较 balanced、left-deep、right-deep 能说明拓扑影响结果，却不能证明模型能自己找到拓扑。动态拓扑不是当前第一优先级；统一状态和 READ 合同未固定前，搜索更大拓扑只会扩大不稳定目标。</p>
<h2 id="5-多分辨率概率状态">5. 多分辨率概率状态</h2>
<h3 id="51-节点质量与-prototype">5.1 节点质量与 prototype</h3>
<p>设节点 <code>v</code> 下 token 的质量为 <code>a_t,v</code>，其 context 概率行为 <code>p_t</code>。节点总质量与原型为：</p>
$$
M_v=\sum_t a_{t,v},
\qquad
\mu_v=\frac{\sum_t a_{t,v}p_t}{M_v}.
$$<p><code>mu_v</code> 与 token 背景行具有同一维度、同一概率单位。root 表示全局混合背景；向下进入更小子群后，prototype 增加区分信息。</p>
<h3 id="52-概率-fold">5.2 概率 FOLD</h3>
<p>对左右 child：</p>
$$
M_P=M_L+M_R,
\qquad
\mu_P=\frac{M_L\mu_L+M_R\mu_R}{M_P}.
$$<p>它满足质量守恒：</p>
$$
M_P\mu_P=M_L\mu_L+M_R\mu_R.
$$<p>parent 仍位于同一概率单纯形，因此该 FOLD 在数据类型和量纲上闭合。</p>
<h3 id="53-概率残差">5.3 概率残差</h3>
<p>child 相对 parent 的残差为：</p>
$$
\delta_C=\mu_C-\mu_P.
$$<p>沿 root-to-node 路径累加：</p>
$$
\mu_v=\mu_{\mathrm{root}}+
\sum_{C\in\mathrm{path}(\mathrm{root}\to v)}\delta_C.
$$<p>可以精确恢复已存储的节点 prototype。对单 token 还可保存：</p>
$$
\delta_t=p_t-\mu_{\ell(t)}.
$$<p>这能恢复完整 token 背景行，也能测量 TreeHeap 量化丢失的信息。</p>
<p>残差目前是代数差，不是独立学会的记忆。精确恢复证明数据没有丢失，不证明 parent 已获得生成所需语义。</p>
<h3 id="54-coarse-与-fine">5.4 coarse 与 fine</h3>
<p>当前采用的概念是：</p>
$$
\begin{aligned}
\mathrm{coarse\ state}&=\mathrm{larger\ support}+\mathrm{shared\ constraints},\\
\mathrm{fine\ state}&=\mathrm{smaller\ support}+\mathrm{additional\ distinctions}.
\end{aligned}
$$<p>coarse 不等于数值更小，fine 不等于向量更长。分辨率由状态能排除多少候选、能区分多少结构以及覆盖哪些 occurrence 决定。</p>
<h3 id="55-分辨率不确定性假设">5.5 分辨率不确定性假设</h3>
<p>当前待验证假设是：coarse 路由可以较集中、较稳定，而 fine 路由保留多个可能分支。对 token <code>x</code> 在深度 <code>d</code> 的节点分布：</p>
$$
p_d(v\mid x)=
\sum_{\ell\in\mathrm{Leaves}(v)}e_x(\ell).
$$<p>需要逐层测量：</p>
<ul>
<li>节点熵；</li>
<li>条件分支熵；</li>
<li>calibration；</li>
<li>posterior concentration；</li>
<li>有效 leaf 数；</li>
<li>对下游目标的条件信息。</li>
</ul>
<p>这些指标不等价。更深层背景预测更好，不自动证明 fine 更随机或更确定。</p>
<h3 id="56-两种不同的不确定性">5.6 两种不同的不确定性</h3>
<p>必须分开：</p>
<ol>
<li><strong>表征不确定性：</strong> Decoder 运行前，TreeHeap 状态已在多个 fine 分支分配概率；</li>
<li><strong>采样不确定性：</strong> Decoder 形成 logits 后，生成策略从词表概率中采样。</li>
</ol>
<p>目标是允许 coarse 含义稳定，而措辞、局部细节或等价表达在 fine 层保留多个实现。不能用增加 sampling temperature 代替表示层面的验证。</p>
<h2 id="6-统一-treestate-合同">6. 统一 TreeState 合同</h2>
<h3 id="61-为什么需要统一状态">6.1 为什么需要统一状态</h3>
<p>当前概率路线使用归一化 context 分布，历史序列路线使用普通 hidden vector，可逆 Lifting 又使用 parent/detail 对。如果这些对象只因 tensor shape 相同就互相连接，FOLD 的物理含义和 READ 的输入合同都会消失。</p>
<p>当前目标数据结构为：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>TreeState {
</span></span><span style="display:flex;"><span>  common    // 当前尺度稳定保留的公共成分
</span></span><span style="display:flex;"><span>  detail    // 区分更细状态所需的残差
</span></span><span style="display:flex;"><span>  mass      // 概率质量或证据量
</span></span><span style="display:flex;"><span>  address   // 节点、深度和路径
</span></span><span style="display:flex;"><span>  order     // 序列位置、方向或非交换关系
</span></span><span style="display:flex;"><span>  support   // 当前状态覆盖的 occurrence 范围
</span></span><span style="display:flex;"><span>}
</span></span></code></pre></div><p>字段是否都显式存储可以调整，但每类信息必须有明确去处。</p>
<h3 id="62-闭合要求">6.2 闭合要求</h3>
<p>对状态族 <code>S</code>：</p>
$$
s_L,s_R\in\mathcal S
\quad\Longrightarrow\quad
\operatorname{FOLD}(s_L,s_R)\in\mathcal S.
$$<p>若发生类型变化，必须显式命名新的空间和转换，而不能继续称为同一种 TreeState。</p>
<p>闭合只保证规则自洽，不保证可逆、语义正确或任务充分。</p>
<h2 id="7-从概率-fold-到保序序列-fold">7. 从概率 FOLD 到保序序列 FOLD</h2>
<h3 id="71-当前概率平均为什么不够">7.1 当前概率平均为什么不够</h3>
<p>质量加权平均满足：</p>
$$
\operatorname{FOLD}(a,b)=\operatorname{FOLD}(b,a).
$$<p>它可以描述两个 token 共同覆盖的背景，却无法区分 <code>dog bites man</code> 与 <code>man bites dog</code>。因此它是概率状态基线，不是完整序列 Encoder。</p>
<h3 id="72-occurrence-write">7.2 occurrence WRITE</h3>
<p>序列 Encoder 的输入不能只有静态 type Embedding。需要由当前句子构造 posterior occurrence：</p>
$$
s_i=\operatorname{WRITE}\!\left(
e_{t_i},\operatorname{pos}_i,c_i,d_{\mathrm{task}}
\right).
$$<p>同一个 token 在不同句子中可以得到不同 <code>s_i</code>，同时保留与 type 背景场的可追踪关系。</p>
<h3 id="73-保序-fold-的最低合同">7.3 保序 FOLD 的最低合同</h3>
<p>完整候选至少应具有：</p>
$$
s_P=\operatorname{Normalize}\!\left(
C(s_L,s_R)+O(s_L,s_R)+D(s_L,s_R)
\right),
$$<p>其中 $C$ 表示公共成分，$O$ 表示有序交互，$D$ 表示保留的 detail。</p>
<p>它必须满足：</p>
<ol>
<li><code>FOLD(a,b)</code> 与 <code>FOLD(b,a)</code> 在需要时可区分；</li>
<li>parent 仍属于声明的状态族；</li>
<li>数值随深度不爆炸、不消失；</li>
<li>梯度能到达左右 child 与节点参数；</li>
<li>detail 不能成为绕过 parent 的原文直通通道；</li>
<li>不同深度具有可测量的分辨率变化。</li>
</ol>
<p>当前尚无一个被接受的算子同时完成这些要求。这是主架构最大的算法缺口。</p>
<h3 id="74-可逆性与任务充分性">7.4 可逆性与任务充分性</h3>
<p>历史可逆 Lifting 证明了：parent 与 detail 可以精确恢复两个 child。该结果仍是有价值的 reference，但不再等同于当前目标。</p>
<p>生成任务更核心的条件是：</p>
$$
p(Y\mid X)\approx p(Y\mid P),
\qquad P=\operatorname{FOLD}(X).
$$<p>其中 <code>P=FOLD(X)</code>。parent 可以是有损的，只要它保留目标 <code>Y</code> 所需的条件分布；反之，精确可逆也可能只是把无关输入搬进 detail。</p>
<p>因此当前目标是“可审计的目标充分压缩”，而不是要求每层都能无损还原整句。</p>
<h3 id="75-butterfly-的当前位置">7.5 Butterfly 的当前位置</h3>
<p>XOR-Butterfly 能让远距离 leaf 在对数阶段建立通信路径，历史 WMT 实验也显示它在指定合同中优于两个对照。它解决的是长程通信，不解决 Embedding、概率闭合或保序 FOLD。</p>
<p>在当前架构中，Butterfly 是可选通信模块。只有当统一 TreeState 与 FOLD 合同固定后，才能判断它应放在 FOLD 前、层间还是由其他稀疏通信替代。</p>
<h2 id="8-readdecoder-与私有协议">8. READ、Decoder 与私有协议</h2>
<h3 id="81-read-的目标">8.1 READ 的目标</h3>
<p>READ 接收 Decoder 当前 query，从 root、internal、leaf 与 detail 中选择或混合状态：</p>
$$
r_t=\operatorname{READ}(q_t,\mathcal S_{\mathrm{tree}}).
$$<p>理想 READ 可以先使用 coarse 状态，再只展开当前 query 需要的 fine 分支。它不是机械走到 leaf，也不要求每层贡献相同。</p>
<h3 id="82-两类已有-read">8.2 两类已有 READ</h3>
<p>冻结 Bayesian READ 使用观测 context 与背景条件分布比较候选 token。它证明多分辨率概率场含有可读信息，但不是自由生成 Decoder。</p>
<p>历史递归 READ 根据 Decoder hidden state 分配 stop 与 branch 概率。它证明多层读取可以参与 seq2seq，但 STOP 曾发生向 leaf 坍缩，也尚未与最新概率 Embedding 使用同一 TreeState。</p>
<p>二者都是 reference，不是已经合并的最终 READ。</p>
<h3 id="83-decoder">8.3 Decoder</h3>
<p>自回归 Decoder 的基本合同是：</p>
$$
\ell_t=\operatorname{Decoder}(y_{\lt t},r_t),
\qquad
P(y_t)=\operatorname{softmax}(\ell_t).
$$<p>Decoder 不需要恢复一个人类命名的“主视角”，也不需要与 Encoder 共享参数。它需要能够读取 TreeState，并通过最终任务 loss 对上游状态形成方向信息。</p>
<h3 id="84-私有协议的可检验定义">8.4 私有协议的可检验定义</h3>
<p>私有协议不是神秘语言。它表示 Encoder 产生的状态与 Decoder 的读取规则在训练中共同适配。</p>
<p>协议成立至少要求：</p>
<ol>
<li>输入变化造成 TreeState 与输出变化；</li>
<li>干预某层状态会产生可预测的输出变化；</li>
<li>Decoder 不能仅靠目标前缀达到同样效果；</li>
<li>梯度从任务 loss 到达 WRITE、FOLD 与路由参数；</li>
<li>checkpoint 保存和重载后行为一致；</li>
<li>多 seed 下功能关系可复现，即使内部坐标可以旋转或置换。</li>
</ol>
<h2 id="9-训练目标与梯度职责">9. 训练目标与梯度职责</h2>
<h3 id="91-分阶段目标">9.1 分阶段目标</h3>
<p>不同 loss 回答不同问题，不能只报告一个总数。</p>
<table>
  <thead>
      <tr>
          <th>目标</th>
          <th>保护的性质</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>background reconstruction NLL</td>
          <td>token 背景几何是否可预测</td>
      </tr>
      <tr>
          <td>routing utilization / entropy</td>
          <td>是否发生路径坍缩</td>
      </tr>
      <tr>
          <td>contrastive objective</td>
          <td>邻域吸引与互斥关系</td>
      </tr>
      <tr>
          <td>order discrimination</td>
          <td><code>AB</code> 与 <code>BA</code> 是否可区分</td>
      </tr>
      <tr>
          <td>closure / normalization</td>
          <td>FOLD 后状态是否合法</td>
      </tr>
      <tr>
          <td>task token NLL</td>
          <td>状态能否被 Decoder 用于目标任务</td>
      </tr>
      <tr>
          <td>retention / replay</td>
          <td>新数据加入后旧背景是否遗忘</td>
      </tr>
      <tr>
          <td>generation gates</td>
          <td>输入因果、非空、重复率、长度与主观质量</td>
      </tr>
  </tbody>
</table>
<h3 id="92-端到端梯度链">9.2 端到端梯度链</h3>
<p>目标链路为：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>generation loss
</span></span><span style="display:flex;"><span>  -&gt; Decoder
</span></span><span style="display:flex;"><span>  -&gt; READ
</span></span><span style="display:flex;"><span>  -&gt; sequence FOLD / communication
</span></span><span style="display:flex;"><span>  -&gt; occurrence WRITE
</span></span><span style="display:flex;"><span>  -&gt; probabilistic Embedding / node parameters
</span></span></code></pre></div><p>架构图不能证明梯度真实到达。正式训练必须记录各参数组的梯度范数、更新量、节点占用和逐层贡献。</p>
<h3 id="93-门禁不追求一次找到全局极值">9.3 门禁，不追求一次找到全局极值</h3>
<p>当前采用可用性门禁：第一阶段只要求状态有限、概率守恒、可训练、可重载、比随机路由含有更多信息，并能可靠交给 READ。通过后再优化拓扑、稀疏度、速度和极值。</p>
<p>这避免为了寻找理论最优 F，无限制消耗单卡算力；也避免因一次局部负结果提前终止整个函数族。</p>
<h2 id="10-当前证据地图">10. 当前证据地图</h2>
<h3 id="101-已经建立的有限事实">10.1 已经建立的有限事实</h3>
<table>
  <thead>
      <tr>
          <th>对象</th>
          <th>当前支持</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>背景概率场</td>
          <td>可以从真实语料构造、冻结和重载</td>
      </tr>
      <tr>
          <td>硬树搜索</td>
          <td>Monte Carlo 在登记数据上优于初始树和随机路由</td>
      </tr>
      <tr>
          <td>软树训练</td>
          <td>路由参数可微、可更新，路径可改变且不必坍缩</td>
      </tr>
      <tr>
          <td>多分辨率读取</td>
          <td>登记实验中，更深状态保留更多背景预测信息</td>
      </tr>
      <tr>
          <td>概率 FOLD</td>
          <td>质量守恒、归一化闭合、残差可重建节点原型</td>
      </tr>
      <tr>
          <td>双元概率组合</td>
          <td>在有限未见三元组 smoke 中含有超出 unigram 的条件信息</td>
      </tr>
      <tr>
          <td>顺序缺失</td>
          <td>当前平均组合严格满足交换律，因此不含顺序</td>
      </tr>
      <tr>
          <td>长程通信 reference</td>
          <td>历史 Butterfly WMT 匹配实验显示指定合同内稳定收益</td>
      </tr>
  </tbody>
</table>
<h3 id="102-代表性量化-reference">10.2 代表性量化 reference</h3>
<p>在硬树搜索中，深度 3、4、5、6 的多 seed sealed-test 重建 NLL 中位改善约为：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>depth 3: 0.0540
</span></span><span style="display:flex;"><span>depth 4: 0.0451
</span></span><span style="display:flex;"><span>depth 5: 0.0505
</span></span><span style="display:flex;"><span>depth 6: 0.0296
</span></span></code></pre></div><p>这说明搜索到的分区不是完全随机摆放，但不能说明更深必然更好，也不能说明轴获得了人类可读语义。</p>
<p>在 READ-coupled 软路由实验中：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>soft field NLL: 4.758578
</span></span><span style="display:flex;"><span>hardened NLL:   4.899335
</span></span><span style="display:flex;"><span>damage:         0.140757
</span></span></code></pre></div><p>它把问题定位到 soft-to-hard 交接：信息存在于混合路径中，突然硬化会丢失它。</p>
<p>历史 Butterfly 三种子 WMT 对照的平均 NLL 为：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>Identity:   4.65196
</span></span><span style="display:flex;"><span>Adjacent:   4.65415
</span></span><span style="display:flex;"><span>Butterfly:  4.56509
</span></span></code></pre></div><p>这只作为长程通信模块的 reference，不证明最新概率 Embedding 与序列 FOLD 已经接通。</p>
<h3 id="103-当前证据不允许的结论">10.3 当前证据不允许的结论</h3>
<p>本文不声称：</p>
<ul>
<li>token 已经获得完整语义坐标；</li>
<li>背景场已经是世界模型；</li>
<li>当前树结构对应自然语言语法树；</li>
<li>已经找到唯一或最终 F；</li>
<li>soft 路由可以无损硬化；</li>
<li>probability FOLD 已经编码语序；</li>
<li>Encoder、READ 与产品 Decoder 已在最新架构中形成协议；</li>
<li>当前实现优于 matched Transformer；</li>
<li>TreeHeap 已实现实际存储压缩或计算加速；</li>
<li>当前 checkpoint 达到产品级生成质量。</li>
</ul>
<h2 id="11-当前最大断点">11. 当前最大断点</h2>
<h3 id="111-type-embedding-到-occurrence-encoder">11.1 Type Embedding 到 occurrence Encoder</h3>
<p>静态背景坐标必须被句内上下文改写，同时保持与背景场的可追踪关系。缺少这一层，token installer 不能直接承担句子理解。</p>
<h3 id="112-概率状态到保序-fold">11.2 概率状态到保序 FOLD</h3>
<p>当前概率平均闭合但交换；已有可训练 hidden-state FOLD 可保序，却不属于同一概率状态族。需要找到二者之间的正式算子。</p>
<h3 id="113-soft-to-sparse">11.3 soft-to-sparse</h3>
<p>软路由可训练但成本较高，硬化会损伤信息。需要逐步稀疏化、Top-k 路由或一致性蒸馏，而不是训练结束后突然二值化。</p>
<h3 id="114-read-到-decoder-的无旁路闭环">11.4 READ 到 Decoder 的无旁路闭环</h3>
<p>Decoder 必须依赖登记的 TreeState 完成任务。任何 target leakage、leaf 直通或残差原文旁路都会使协议证据失效。</p>
<h3 id="115-增量安装与遗忘">11.5 增量安装与遗忘</h3>
<p>新 token、新语料或新任务进入背景场时，旧路径、原型和 READ 合同怎样保持，需要 replay、冻结层级或状态迁移算法。</p>
<h2 id="12-下一阶段算法路线">12. 下一阶段算法路线</h2>
<h3 id="121-固定-canonical-treestate">12.1 固定 canonical TreeState</h3>
<p>首先定义字段、shape、单位、归一化、mask 和 checkpoint schema。概率 FOLD、保序 FOLD、Lifting reference 与 READ 都实现同一接口。</p>
<h3 id="122-实现-context-conditioned-write">12.2 实现 context-conditioned WRITE</h3>
<p>输入静态 type Embedding、位置和句内 context，输出 occurrence TreeState。先用受控多义词和顺序任务验证，不直接跳到大规模生成。</p>
<h3 id="123-实现最小保序-fold">12.3 实现最小保序 FOLD</h3>
<p>从双元开始，要求：</p>
<ul>
<li><code>AB</code> 与 <code>BA</code> 可区分；</li>
<li>状态闭合；</li>
<li>梯度有限；</li>
<li>parent 比 flat/random baseline 保留更多目标信息；</li>
<li>detail 不形成旁路。</li>
</ul>
<h3 id="124-定义逐层分辨率曲线">12.4 定义逐层分辨率曲线</h3>
<p>同时记录节点熵、条件分支熵、有效 leaf、目标信息代理、顺序辨识率、READ 质量和生成变化。只用一个 NLL 无法说明多分辨率形成。</p>
<h3 id="125-接入-resolution-aware-read">12.5 接入 resolution-aware READ</h3>
<p>让 READ 在 query 条件下从 coarse 开始，按需展开 fine 状态。比较固定深度、全层平均、可学习软读取和稀疏读取。</p>
<h3 id="126-串联-decoder-并做因果审计">12.6 串联 Decoder 并做因果审计</h3>
<p>完成：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>probabilistic Embedding
</span></span><span style="display:flex;"><span>  -&gt; occurrence WRITE
</span></span><span style="display:flex;"><span>  -&gt; ordered FOLD
</span></span><span style="display:flex;"><span>  -&gt; multiresolution TreeState
</span></span><span style="display:flex;"><span>  -&gt; READ
</span></span><span style="display:flex;"><span>  -&gt; Decoder
</span></span></code></pre></div><p>随后进行 source shuffle、state shuffle、depth ablation、order reversal、reload equality 和 matched baseline。</p>
<h3 id="127-在消费级硬件上形成-release">12.7 在消费级硬件上形成 release</h3>
<p>TreeHeap 的工程目标是在 24GB 级消费 GPU 上完成：</p>
<ul>
<li>可恢复训练；</li>
<li>固定评测；</li>
<li>checkpoint handoff；</li>
<li>本地 CLI 推理；</li>
<li>model card、哈希与限制说明。</li>
</ul>
<p>更大硬件可以验证尺度规律，但不能成为架构成立的前提。</p>
<h2 id="13-release-的定义与时间边界">13. Release 的定义与时间边界</h2>
<p>“发布”必须分级，否则研究代码公开、研究 checkpoint 和可用模型会被混为一谈。</p>
<h3 id="r0理论与研究代码发布">R0：理论与研究代码发布</h3>
<p>当前已经具备公开 Blog、ARA、组件代码和局部 checkpoint。本文本身属于这一层。</p>
<h3 id="r1可复现研究原型">R1：可复现研究原型</h3>
<p>要求 canonical TreeState、最小 occurrence WRITE、保序 FOLD、READ/Decoder smoke、checkpoint reload 与 CLI 全部串联。若不出现新的基础反例，按单卡研发节奏估计需要 <strong>4 到 8 周</strong>。</p>
<h3 id="r2可供外部试用的-treeheap-模型">R2：可供外部试用的 TreeHeap 模型</h3>
<p>要求真实语料训练、多 seed、matched baseline、稳定自由生成、model card 和一键推理。在 R1 成立之后，保守估计还需 <strong>2 到 4 个月</strong>。</p>
<h3 id="r3具有产品意义的本地-ai">R3：具有产品意义的本地 AI</h3>
<p>要求质量、速度、内存、增量学习、安全和长期维护均达到可用门槛。当前证据不足以给出可靠日期，不能把它承诺为某个固定月份。</p>
<p>这些是条件估计，不是日历保证。若保序 FOLD 或 soft-to-sparse 被反证，R1 时间需要重新计算；若现有组件顺利接通，则可以提前。</p>
<h2 id="14-反证条件">14. 反证条件</h2>
<p>理论路线应被降级或修改，如果稳定出现以下结果：</p>
<ol>
<li>搜索或训练后的树长期不能胜过随机树、flat 概率模型或普通 Embedding；</li>
<li>打乱 token 与背景概率行的对应关系后，READ 质量不下降；</li>
<li>多个 seed 的功能关系无法复现，且坐标对齐后仍不存在共同结构；</li>
<li>保序 FOLD 无法同时满足闭合、有限梯度和目标信息保留；</li>
<li>任何可接受成本的稀疏化都会消除软路由收益；</li>
<li>Decoder 总能绕过 TreeHeap，结构干预不影响输出；</li>
<li>matched Transformer 或简单概率模型在同资源下稳定占优，而 TreeHeap 没有提供新的能力、可观察性或成本优势；</li>
<li>24GB 消费 GPU 无法支持最小可恢复训练与本地推理合同。</li>
</ol>
<p>负结果不需要删除。它用于缩小函数族和重新安排架构边界。</p>
<h2 id="15-可复现性">15. 可复现性</h2>
<p>公开研究遵循 ARA：</p>
<div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;"><code class="language-text" data-lang="text"><span style="display:flex;"><span>Claim
</span></span><span style="display:flex;"><span>  -&gt; Predict
</span></span><span style="display:flex;"><span>  -&gt; Experiment contract
</span></span><span style="display:flex;"><span>  -&gt; Evidence
</span></span><span style="display:flex;"><span>  -&gt; Decision
</span></span></code></pre></div><p>正式实验至少保存：代码 commit、数据 manifest 与 SHA-256、随机种子、完整命令、环境、日志、summary、必要 checkpoint、reload 审计和失败条件。</p>
<p>核心入口：</p>
<ul>
<li><a href="https://github.com/houming818/sametime">SameTime repository</a></li>
<li><a href="/spr/">SPR 研究路线</a></li>
<li><a href="/treeheap-theory.html">TreeHeap 当前理论状态与目标</a></li>
<li><a href="/spr/091-treeheap-f-function-guide.html">F 函数说明</a></li>
<li><a href="/spr/092-treeheap-concept-implementation-roadmap.html">概念与实现路线图</a></li>
</ul>
<h2 id="16-数学与方法背景">16. 数学与方法背景</h2>
<p>TreeHeap 没有声称从零发明所有数学对象。当前理论与下列方向存在明确联系：</p>
<ol>
<li><strong>Distributional hypothesis：</strong> 用上下文分布描述词的使用环境；</li>
<li><strong>Hellinger geometry：</strong> 用平方根概率坐标比较离散分布；</li>
<li><strong>Hierarchical probabilistic models：</strong> 用树分解大候选空间；</li>
<li><strong>Monte Carlo / simulated annealing：</strong> 在离散或混合空间搜索局部结构；</li>
<li><strong>Differentiable routing：</strong> 用 soft gate 让路由参数接受梯度；</li>
<li><strong>Information bottleneck：</strong> 区分无损恢复与目标充分统计；</li>
<li><strong>Lifting scheme：</strong> 用 coarse 与 detail 构造可逆多尺度 reference；</li>
<li><strong>Butterfly factorization：</strong> 用分阶段稀疏变换建立长程通信。</li>
</ol>
<p>参考文献：</p>
<ol>
<li>Harris, Z. S. <em>Distributional Structure</em>. Word, 1954.</li>
<li>Gutmann, M., and Hyvärinen, A. <em>Noise-Contrastive Estimation</em>. AISTATS, 2010.</li>
<li>Morin, F., and Bengio, Y. <em>Hierarchical Probabilistic Neural Network Language Model</em>. AISTATS, 2005.</li>
<li>Tishby, N., Pereira, F. C., and Bialek, W. <em>The Information Bottleneck Method</em>. 1999.</li>
<li>Sweldens, W. <em>The Lifting Scheme: A Custom-Design Construction of Biorthogonal Wavelets</em>. Applied and Computational Harmonic Analysis, 1996.</li>
<li>Dao, T., Gu, A., Eichhorn, M., Rudra, A., and Ré, C. <em>Learning Fast Algorithms for Linear Transforms Using Butterfly Factorizations</em>. ICML, 2019.</li>
</ol>
<p>这些工作提供数学工具和邻近思想，不代表 TreeHeap 已被证明等价于其中任何一种模型。</p>
<h2 id="17-结论">17. 结论</h2>
<p>TreeHeap 当前的理论起点已经从“先造一棵树，再期待语义涌现”发生改变。现在的顺序是：先从语料构造 token 的概率背景观测；再让单位质量从 root 经局部主轴与阈值概率下坠，形成 leaf、路径和多分辨率 Embedding；然后要求句子 FOLD 在同一状态族中闭合、保序并对目标充分；最后由 READ 选择所需分辨率，Decoder 将其变成生成分布。</p>
<p>Monte Carlo、梯度下降和拓扑搜索都是寻找节点参数的工具，不是 F 本身。概率平均 FOLD 已经给出量纲与守恒基线，却因交换律无法承担完整序列组合。可逆 Lifting 与 Butterfly 仍提供有价值的数学和通信 reference，但不再单独定义最新理论。当前最重要的未知对象，是一个对软多分辨率概率状态闭合、能够表达顺序、还能被 READ/Decoder 消费的序列 FOLD。</p>
<p>现有证据说明这条路线不是纯粹想象：背景场可以构造，树可以被搜索和训练，状态可以保存重载，多层概率含有可读信息，软路由也能接受下游梯度。但从“可编码”到“可组织”，再到“可消费”，最后一段仍未闭合。</p>
<p>因此，项目下一阶段不再扩张核心术语，而是固定 canonical TreeState，完成 occurrence WRITE、保序 FOLD、分辨率曲线和无旁路 READ/Decoder。第一艘可发布的 TreeHeap，不需要一次成为通用智能；它需要在消费级硬件上成为一个诚实、完整、可运行、可反驳的研究原型。</p>
<h2 id="附录-a当前-claim-边界">附录 A：当前 Claim 边界</h2>
<table>
  <thead>
      <tr>
          <th>陈述</th>
          <th>当前状态</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>真实语料可构造 token 背景概率场</td>
          <td>支持</td>
      </tr>
      <tr>
          <td>TreeHeap 硬路由可以由 Monte Carlo 改善</td>
          <td>有界任务支持</td>
      </tr>
      <tr>
          <td>TreeHeap 软路由可微并可由梯度更新</td>
          <td>支持</td>
      </tr>
      <tr>
          <td>概率 FOLD 保持质量、归一化和节点类型闭合</td>
          <td>由公式成立</td>
      </tr>
      <tr>
          <td>残差可以重建已存储节点 prototype</td>
          <td>由定义与数值检查支持</td>
      </tr>
      <tr>
          <td>更深状态在登记实验中含更多背景预测信息</td>
          <td>有界支持</td>
      </tr>
      <tr>
          <td>coarse 必然更确定、fine 必然更随机</td>
          <td>开放</td>
      </tr>
      <tr>
          <td>当前概率 FOLD 能表示 token 顺序</td>
          <td>否，交换律反证</td>
      </tr>
      <tr>
          <td>已找到统一序列 F</td>
          <td>否</td>
      </tr>
      <tr>
          <td>最新 Embedding 已接入产品 Decoder</td>
          <td>否</td>
      </tr>
      <tr>
          <td>Encoder/Decoder 私有协议在最新架构中成立</td>
          <td>开放</td>
      </tr>
      <tr>
          <td>TreeHeap 已优于 matched Transformer</td>
          <td>未证明</td>
      </tr>
      <tr>
          <td>TreeHeap 已实现实际压缩或加速</td>
          <td>未证明</td>
      </tr>
  </tbody>
</table>
<h2 id="附录-b符号表">附录 B：符号表</h2>
<table>
  <thead>
      <tr>
          <th>符号</th>
          <th>含义</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td><code>t</code></td>
          <td>token type</td>
      </tr>
      <tr>
          <td><code>c</code></td>
          <td>corpus context feature 或 context token</td>
      </tr>
      <tr>
          <td><code>p_t(c)</code></td>
          <td>token <code>t</code> 的条件背景概率</td>
      </tr>
      <tr>
          <td><code>x_t</code></td>
          <td>平方根概率坐标 <code>sqrt(p_t)</code></td>
      </tr>
      <tr>
          <td><code>v</code></td>
          <td>TreeHeap 节点</td>
      </tr>
      <tr>
          <td><code>w_v</code></td>
          <td>节点局部观察轴</td>
      </tr>
      <tr>
          <td><code>b_v</code></td>
          <td>节点阈值</td>
      </tr>
      <tr>
          <td><code>tau_v</code></td>
          <td>节点 soft-route 温度</td>
      </tr>
      <tr>
          <td><code>g_v(t)</code></td>
          <td>token 在节点走向 right 的概率</td>
      </tr>
      <tr>
          <td><code>e_t</code></td>
          <td>token 在 leaf 上的概率 Embedding</td>
      </tr>
      <tr>
          <td><code>M_v</code></td>
          <td>节点概率质量或证据量</td>
      </tr>
      <tr>
          <td><code>mu_v</code></td>
          <td>节点 context prototype</td>
      </tr>
      <tr>
          <td><code>delta_v</code></td>
          <td>child 相对 parent 的概率残差</td>
      </tr>
      <tr>
          <td><code>f_v</code></td>
          <td>单节点函数</td>
      </tr>
      <tr>
          <td><code>F_Theta</code></td>
          <td>全部节点函数组成的整树映射</td>
      </tr>
      <tr>
          <td><code>A</code></td>
          <td>Monte Carlo、梯度或拓扑学习算法</td>
      </tr>
      <tr>
          <td><code>TreeState</code></td>
          <td>统一的多分辨率状态合同</td>
      </tr>
      <tr>
          <td><code>Y</code></td>
          <td>下游目标序列或任务变量</td>
      </tr>
  </tbody>
</table>
<h2 id="附录-c一句话版本">附录 C：一句话版本</h2>
<blockquote>
<p>TreeHeap 让 token 携带语料概率从 root 开始下坠，在局部节点中形成多分辨率坐标；它正在寻找一种对这些概率状态闭合且保序的 FOLD，使 READ 和 Decoder 能在消费级硬件上学习并使用同一套生成协议。</p></blockquote>
]]></content:encoded>
    </item>
  </channel>
</rss>
