TreeHeap 开放术语表
这不是要求读者记忆的一套黑话,而是一张翻译表。每个词都标明它是公共领域中的标准概念, 还是 TreeHeap 为了记录工程设计而使用的项目名称。文章第一次使用术语时仍应就地解释,不能 把理解成本全部推给本页。
最短架构图
文本 -> token -> embedding -> TreeHeap Encoder
-> 多层状态 / 路径 -> READ -> Decoder -> 输出 token
token是输入输出的离散单位。embedding把离散编号变成可计算向量。Encoder把输入写成 TreeHeap 内部状态。READ从不同树层选择或组合信息。Decoder把内部状态变成词表上的输出概率。
公共数学与机器学习术语
| 术语 | 简明定义 | 在 TreeHeap 中的用途 |
|---|---|---|
| token | 文本切分后的计算单位 | 作为模型的输入与输出符号 |
| embedding | token 到数值向量的映射 | 为距离、组合和预测提供连续表示 |
| hidden state / 隐态 | 模型内部暂存的信息向量 | 保存编码和递归计算的中间结果 |
| logits | softmax 之前、尚未归一化的词表分数 | Decoder 用它形成下一个 token 的概率 |
| entropy / 熵 | 概率分布不确定性的度量 | 检查候选空间是在收缩还是扩散 |
| NLL | 正确答案负对数概率的平均值 | 衡量模型给参考答案分配了多少概率 |
| JS 散度 | 两个概率分布之间的对称差异指标 | 比较 token 或节点原型的分布差异 |
| 概率单纯形 | 非负、总和为 1 的向量空间 | 表示 token 在多个叶子之间的位置 |
| 协方差 | 多维数据各方向共同变化的统计量 | 描述一个节点内 token 群的形状 |
| PCA / 主轴 | 找到数据变化最大方向的方法 | 给每个节点计算局部分类方向 |
| 固定点 | 满足 $x=F(x)$ 的稳定状态 | 表示再次迭代后位置与路径不再变化 |
| 消融 | 移除一个组件并比较变化 | 检验收益是否真的来自该组件 |
TreeHeap 项目术语
| 术语 | 简明定义 | 它不表示什么 |
|---|---|---|
| TreeHeap | 用 root、内部节点和 leaf 组织多分辨率状态的实验架构 | 不是经典 heap 数据结构的直接改名 |
| FOLD | 从较细状态递归构造较粗 parent 状态 | 不自动等于语义理解 |
| UNFOLD | 从较粗状态向更细结构传播或生成 | 不保证能无损恢复原文 |
| READ | 从树的一层或多层抽取状态交给 Decoder | 不等同于数据库读取 |
| 下坠 | token 从 root 经内部节点到 leaf 的路由过程 | 不是物理重力模型 |
| 概率路由 | 在节点处以概率选择左右分支 | 不一定是一次不可逆的硬选择 |
| 多分辨率退火 | 让细节逐层组合为较粗状态的设计目标 | 目前不是已证明的物理定律 |
| 私有协议 | Encoder 与 Decoder 在训练中形成的内部表示约定 | 不意味着加密或刻意闭源 |
| 概率 Hash | 对旧路由的诊断性称呼:地址稳定,但语义层级尚未证明 | 不是标准 Hash 算法名 |
ARA 证据语言
| 术语 | 含义 |
|---|---|
| Claim | 可以被实验或推理反驳的明确主张 |
| Predict | 如果 Claim 成立,应提前观察到什么 |
| Experiment | 控制变量、数据、步骤与停止条件 |
| Evidence | 原始日志、指标、样例、哈希与复现记录 |
| Decision | 证据支持继续、修改、暂停还是否定 Claim |
| E1-E4 | 项目内部的证据强度标签,不是通行的学术评级标准 |
实验编号怎样阅读
A09、A10、C03、D11 等名称只是仓库中的实验航段编号。编号本身不携带技术含义,
文章必须在首次出现时写出实验目的。读者不应为了理解一篇文章,被迫先读完此前全部日志。
写作约定
后续公开文章遵守四条规则:
- 标题先写研究问题,不把内部编号当作主要信息;
- 术语第一次出现时用一句普通语言定义;
- 明确区分标准术语、项目术语和比喻;
- 每篇文章都能独立说明已知、未知和反证条件。
术语表会随架构变化而更新。旧文章与本页冲突时,应以带证据的最新定义为准,而不是以出现 次数最多的说法为准。