TreeHeap 开放术语表

这不是要求读者记忆的一套黑话,而是一张翻译表。每个词都标明它是公共领域中的标准概念, 还是 TreeHeap 为了记录工程设计而使用的项目名称。文章第一次使用术语时仍应就地解释,不能 把理解成本全部推给本页。

最短架构图

文本 -> token -> embedding -> TreeHeap Encoder
     -> 多层状态 / 路径 -> READ -> Decoder -> 输出 token
  • token 是输入输出的离散单位。
  • embedding 把离散编号变成可计算向量。
  • Encoder 把输入写成 TreeHeap 内部状态。
  • READ 从不同树层选择或组合信息。
  • Decoder 把内部状态变成词表上的输出概率。

公共数学与机器学习术语

术语 简明定义 在 TreeHeap 中的用途
token 文本切分后的计算单位 作为模型的输入与输出符号
embedding token 到数值向量的映射 为距离、组合和预测提供连续表示
hidden state / 隐态 模型内部暂存的信息向量 保存编码和递归计算的中间结果
logits softmax 之前、尚未归一化的词表分数 Decoder 用它形成下一个 token 的概率
entropy / 熵 概率分布不确定性的度量 检查候选空间是在收缩还是扩散
NLL 正确答案负对数概率的平均值 衡量模型给参考答案分配了多少概率
JS 散度 两个概率分布之间的对称差异指标 比较 token 或节点原型的分布差异
概率单纯形 非负、总和为 1 的向量空间 表示 token 在多个叶子之间的位置
协方差 多维数据各方向共同变化的统计量 描述一个节点内 token 群的形状
PCA / 主轴 找到数据变化最大方向的方法 给每个节点计算局部分类方向
固定点 满足 $x=F(x)$ 的稳定状态 表示再次迭代后位置与路径不再变化
消融 移除一个组件并比较变化 检验收益是否真的来自该组件

TreeHeap 项目术语

术语 简明定义 它不表示什么
TreeHeap 用 root、内部节点和 leaf 组织多分辨率状态的实验架构 不是经典 heap 数据结构的直接改名
FOLD 从较细状态递归构造较粗 parent 状态 不自动等于语义理解
UNFOLD 从较粗状态向更细结构传播或生成 不保证能无损恢复原文
READ 从树的一层或多层抽取状态交给 Decoder 不等同于数据库读取
下坠 token 从 root 经内部节点到 leaf 的路由过程 不是物理重力模型
概率路由 在节点处以概率选择左右分支 不一定是一次不可逆的硬选择
多分辨率退火 让细节逐层组合为较粗状态的设计目标 目前不是已证明的物理定律
私有协议 Encoder 与 Decoder 在训练中形成的内部表示约定 不意味着加密或刻意闭源
概率 Hash 对旧路由的诊断性称呼:地址稳定,但语义层级尚未证明 不是标准 Hash 算法名

ARA 证据语言

术语 含义
Claim 可以被实验或推理反驳的明确主张
Predict 如果 Claim 成立,应提前观察到什么
Experiment 控制变量、数据、步骤与停止条件
Evidence 原始日志、指标、样例、哈希与复现记录
Decision 证据支持继续、修改、暂停还是否定 Claim
E1-E4 项目内部的证据强度标签,不是通行的学术评级标准

实验编号怎样阅读

A09A10C03D11 等名称只是仓库中的实验航段编号。编号本身不携带技术含义, 文章必须在首次出现时写出实验目的。读者不应为了理解一篇文章,被迫先读完此前全部日志。

写作约定

后续公开文章遵守四条规则:

  1. 标题先写研究问题,不把内部编号当作主要信息;
  2. 术语第一次出现时用一句普通语言定义;
  3. 明确区分标准术语、项目术语和比喻;
  4. 每篇文章都能独立说明已知、未知和反证条件。

术语表会随架构变化而更新。旧文章与本页冲突时,应以带证据的最新定义为准,而不是以出现 次数最多的说法为准。