Lakebase 是一类把 OLTP 的权威数据放在云对象存储上的架构:事务引擎仍是 PostgreSQL,数据以 PostgreSQL 页的格式落在对象存储里。宣传中常被提到的存算分离、计算缩到零、秒级分支,大多在上一代云数据库里已经出现过;它真正新增的部分更窄:持久层换成了通用对象存储,页格式在引擎之外可读,任意已提交的 LSN 都能作为跨引擎的一致性锚点。这篇先把「不新的部分」剥掉,再讨论剩下的部分好在哪里、对谁有用。
代码越来越多由 agent 生成之后,「写代码」不再是架构需要节省的主要成本;定位代码、验证行为、评审 diff、控制改动范围变得更贵。这篇从这个成本变化出发,把项目看成纵向管线(controller → service → adapter)与横向能力(log、metrics、LLM、agent)交织的矩阵,比较几种常见接口做法各自带来什么,再给出一条相对稳的路径:分层决定代码放在哪,接口只标记需要隔离、替换、验证或装饰的依赖边界。
用六个工具动作跑通采样、终局评分、组内优势、裁剪更新与评估。先验证真实参数更新,再接本地语言模型;实验结果同时对照成功轨迹 SFT,并明确它不能证明什么。
训练透明性需要拆成接口解耦与信息隔离。把任意代码执行、可信控制逻辑和私有评分放在明确的边界两侧,才能讨论同一个 harness 如何服务训练、评估和部署。
训练 GPU、推理 GPU 与 CPU 工具环境处理不同工作。系统设计的核心是把模型通信、权重发布、工具请求和训练数据管道分别管理,再用策略版本把它们接成一致的闭环。
终局成功不能证明每一步都好。结果监督、价值基线和过程奖励提供不同的信息;任何细粒度信号都需要说明它来自哪里、何时可靠,以及会诱导什么行为。
这是一篇可选背景。它只帮助理解后训练里“偏好优化”和“环境交互式 RL”的分工,不是继续阅读 PPO、GRPO 和 Agent RL 主线的前置条件。
PPO 和 GRPO 都需要知道一次选择相对基线有多好。前者通常训练 critic,后者用同题采样组估计相对优势;clip、KL、长度归一化分别控制不同的问题。
把模型、harness、可写环境与评分器拆开,才能准确回答:哪些是动作,哪些是观察,哪些 token 参与训练,以及一次失败究竟来自策略还是基础设施。
先把问题说清:后训练是一类训练流程,RL 是其中可选的优化方法;Agent RL 用环境交互的结果,改变模型下一次做选择的概率。

倒排索引不只是
term → docID[]。在这条映射出现之前,Analyzer 必须先决定中文里的「词」是什么;在它之后,Term Dictionary 负责从海量有序词项中定位词块,Posting List 再携带 docID、词频与位置。本文用四篇中文文档贯穿写入链路,把 CJK 分词、词典、倒排表、压缩与 Segment 串成一个可查询的结构。
Term Dictionary 找到的不是最终结果,而是几条等待消费的 Posting Iterator。查询执行器要让这些有序流完成 AND、OR 与 Phrase 匹配,再用 tf、df 和字段长度计算 BM25。本文继续使用四篇中文文档,逐步走完从查询字符串到排名分数的数据流。
BM25 能算出相关性,不代表每篇命中文档都值得精确打分。Top-K 搜索只关心前几名:结果堆产生竞争阈值,WAND 用 term 级分数上界跳过不可能竞争的 docID,Block-Max 再把上界缩小到局部块。只要上界安全,被跳过的文档就不可能进入 Top-K,最终排名仍然精确。
向量索引里的量化,本质是用更少的比特近似保留「距离 / 内积」结构,从而把内存与带宽从 FP32 量级压下来。PQ、RaBitQ、TurboQuant 只是这条线上常被点名的几个点:前面还有精度截断与标量/二值,旁边还有 OPQ / AQ / RQ / LVQ / ScaNN 等码本与损失设计,后面则是随机旋转 + 无偏估计这一支。量化与 IVF / HNSW 等索引结构正交——结构负责缩候选,量化负责让每个候选上的距离更便宜(结构见
向量索引算法全景 )。
向量索引要解决的不是「怎么算距离」,而是少算多少次距离仍能保住近邻。工程上常见的方案可以按「候选从哪来」分成几族:哈希桶、空间树、聚类倒排、近邻图,以及把图/划分搬到磁盘或加速器上的系统。IVF、HNSW、DiskANN 只是各族里最常被点名的代表,不是清单的尽头。量化(PQ / RaBitQ 等)叠在打分层,另文讨论。