两章真实试跑

工程实测 · 2026-09-06 · 候选版本,不是终审发布

可重建的两章样书,
以及实际暴露的问题

用《The Moon and How to Observe It》的前两章实测 PDF→BookMD→HTML。结果支持“先修结构化源数据、再生成 HTML”的方向,但并不支持“换成 Markdown 后质量就自动有保证”:来源归组、译文和参考生图仍会出错,审核建议本身也会引入新错误。

Peter Grego · 原书 2005 年内容物理 PDF 页 12–68原始 PDF 与抽取记录保留修改不落到 HTML 上
57 页真实来源范围,不是测试夹具
31 幅插图;其中 2 幅生图未通过
2 张原生表格,共 194 个格位
6 项原生数学对象

方向可用,但不能把候选计算当作过门

打开前两章试跑样书

样书供检查生成效果,不是正式修订版。

已保留源文、翻译、对象清单、对齐关系与修复记录。两幅月面照片的参考生图连续两次失真,预览暂用原书提取图;它们仍是正式交付的未通过项。没有把未完成的 21 项专项检查写成通过。

这轮最值得保留的改变是:源文和图片有稳定 ID;修复有精确的旧值前置条件;表格、数学和阅读器由固定组件生成。最需要补强的是:审核任务不能自己缩小应审清单,修复建议不能自动执行,照片不能把“生成了更清楚的纹理”等同于“恢复了原来的细节”。

这一次实际做了什么

阶段真实产物与数量负责者这些数字不能证明什么
PDF 来源观察57 页原图与原始文字;另取前后两页作边界参照。固定抽取工具;Luna 视觉读取抽取到对象,不等于 PDF 未检测区域没有内容。
OCR 修订1,761 条 OCR 修订;6 个新增文字候选;不覆盖原始抽取。Luna max提交了修正,不等于修正后的来源已独立确认。
来源归组2,669 个来源原子;252 组;266 项页眉/页码排除;56 条边界;40 条续接;33 个图表对象。Luna 给分组;代码核对所有权每个原子只归属一次,仍不能证明分组含义正确。
翻译与修复202 个正文及图题单元;194 项表格文字;6 项数学口述文字,共 402 个翻译 ID。Spark;少量明确冲突由主控定点裁决ID 和字数齐全,仍可能漏一句或改错关系。
图像全部先有原书提取图;复用有记录的候选,补做参考生图;15 幅生成资产采用像素完全一致的无损 WebP 封装。Luna 判断与比图;内置 ChatGPT Image 生成哈希只能说明资产未变;无损封装只能说明像素未变,都不能替代含义对照。
BookMD→HTML正文、图表、数学各由结构化输入生成;HTML 不接受搜索替换修复。确定性生成器相同输入产生相同输出,也可能稳定地产生错误内容。

表格“194 个格位”和“194 项翻译文字”数值恰好相同,但含义不同:表格有 190 个非空格及 4 个真空格;翻译输入是 190 个非空格 + 2 个图表标题 + 2 个脚注。

真实案例:问题、触发点、处理方法

案例这次实际看到的问题为什么普通检查会漏处理与后续归属
术语表先错,全章跟着错Spark 把 Aldebaran 写成“心宿一(参宿一)”;把不同月海的译名混在一起;词表却写 uncertain=[]。术语“统一”只检查前后相同,不检查词表本身正确。候选词表未进入生产;校准短词表,未核准的专有地名保留原名。归译文忠实度专项。
图题漏译与方位改变图 1.17b 漏掉 Descartes 高地;d 把“某月海以南高地”译成在月海内;f 漏掉撞击熔融坑底。一个 caption ID 覆盖了全部来源,并不代表每句话都译出了。对子图 a–g 逐句比对、按原子 ID 修译文;原总图题不额外添加。归图题翻译忠实度专项。
量级翻译错误4.6–3.9 billion years 被写成“4.6 亿–3.9 亿年”。简单数字比对仍看到 4.6、3.9;单位转换改变了十倍量级。记录数值与单位组合,核对“46 亿–39 亿”。归译文数值忠实度专项,而非科学事实纠错。
审核修复又删掉一句p029-g04 的修复补了壳层压缩,却删掉“数百万度膨胀熔融物泡”;另一处修复把 Imbrium 改成 Tranquillitatis。只检查原问题是否消失,不检查同单元其他内容是否被带坏。拒绝整个坏补丁;按单元精确旧值应用,再对完整单元回归。仍由译文忠实度专项检查,不让“修复者”自签通过。
审核清单自己漏一项第五份译文审核漏掉 p040-g05,却完成了其余 17 项。如果审核者同时定义“应审”清单,就可能自我闭合。独立冻结清单发现缺项;另建任务补查,不能代填 PASS。由代码强制覆盖。
补丁的 before 也会写错两条修改建议的 before 与被审核候选不完全相同。模糊匹配或忽略差异后强行替换,会把错误版本也改掉。精确旧值条件不符即拒绝;重新读取当前单元,另生成定点候选。代码执行前置条件。
列表四项挤成一行Spark 保留了 1–4 的文字,却没有按要求分成四个列表项。纯文字读起来仍完整,HTML 列表却只会得到一个 li。只对该 ID 的四个唯一编号做分行格式化,不跑全书正则。归文本版式专项。
粗斜体承载了表格含义表 1.2 有 4 个格同时粗体与斜体;初始受限解析器不支持 ***文本***。保留数字但丢掉样式,会丢掉“近侧”“埋藏等状态”的含义。生成 <strong><em>…</em></strong> 并做 AST→DOM 投影测试。归表格结构专项。
没有页面溢出,表格仍然难读402px 手机上,九列表格被压到约 593px,总高度约 2,189px;长格位频繁折行。锚点还会把表题顶到悬浮按钮下面。页面 scrollWidth 等于视口宽,只说明页面不横向滚动,不说明表格可读。仅修改阅读器组件:九列表格保留 960px 最小宽,五列表格 576px,各自在容器内滚动;锚点预留 88px 顶部空间。归文本版式专项与锚点操作专项分别检查。
标题级别被旧版拍平本次确认章标题 26pt、二级 16pt、下级 12pt;旧候选中大量下级标题被当作同级。标题文字都存在,目录层级仍可能不对。本次按明确字号层级映射 h1/h2/h3,遇未知字号停下。归文本版式专项。
页边邻块不是续段对象p013 页尾是图题,真正接 p014 的是它前面的未完正文。按“页末块 A + 页首块 B”自动拼接,会把图题吞入正文。物理边界与正文续接分别记录;40 条明确续接独立于图表锚点。归纯文本连续性专项。
同类量级错误仍然残留当前样书 p020-g03 仍把来源 p021-l004 的 “3.5 billion years” 译作“3.5 亿年前”,应为“35 亿年前”。前面修好一处 billion,不代表其他单元已经正确;完成一遍忠实度审核仍可能漏掉。未修复,样书保留为试跑失败证据。必须对全部“数值+单位”逐对核查,不能直接全书替换数字。归译文数值忠实度专项。
常见多义词选错含义p018-g05 把来源 p018-l035 的 “magmatic convection currents” 译成“岩浆对流电流”;这里的 currents 是流动,不是电流。句子语法通顺,字符没有丢,连续性和 ID 检查都会通过。未修复。对照完整原句做语义判断;连续性审核不能代替忠实度审核。归译文忠实度专项。
术语提示被抄进正文p021-g06 的“发电机机制(磁场产生语境)”包含词表中的用法提示;源文 dynamo effects 没有“磁场产生语境”这段注解。生成者把“应该怎么译”的说明当作“要输出的译文”;检查统一用词反而会放过它。未修复。词表必须分离译名与使用说明两个字段;模型仍需区分两者,检查译文不得添加说明。归译文忠实度专项。
修复位置:p029-g04(不是整个 HTML)
前置条件:当前文本 === 补丁.before
修改内容:该单元的源数据文本 / 数学对象 / 表格格位
重建:BookMD + registries + 固定组件 → 新 HTML
回归:原问题消失,同时该单元其他句子、对象顺序和数学 token 保持正确
禁止:模糊匹配后强替换;修改 HTML 再倒推 MD;看到“PASS”就自动写回

照片增强是当前最明确的规则冲突

原图只能支持已有的模糊细节。两次提示都要求保守、不要新增地貌,但图 1.18、2.7 的生成结果仍出现新的坑、射纹或暗斑。下面展示原图与第二次失败候选;它们不是“前后效果都合格”的对比。

原书图1.18提取图,细节模糊但保留原始亮暗版图
图 1.18:原书提取图,物理页 37。
图1.18第二次生图的失败候选,出现原图不支持的细密坑状纹理
第二次生图:未通过。新增纹理不能当作恢复出来的地貌。
原书图2.7低清月面照片,保留原有黑色背景
图 2.7:原书提取图,物理页 58。黑底是原图内容,不是需要随意抠除的页边。
图2.7第二次生成失败候选,锐利坑纹和暗斑超出了原始照片可支持的信息
第二次生图:未通过。更锐利不等于更忠实。
需要用户决定的边界:

若继续坚持“凡低清照片都必须生成”,这两幅就必须维持未通过,不能靠放宽对照标准过门。可选规则是:几何示意图仍按要求参考生图;实景照片连续失败后允许保留源图并明确清晰度限制。该例外尚未作为正式生产规则批准。

当前到底通过了哪些,哪些没有

层次本次状态准确含义
来源候选机械闭合2,669 个原子恰好归属;56 条页边界齐备;状态仍为 draft。来源账本内部一致,不是 PDF 信息全无遗漏的证明。
生成器与故障注入测试41 项测试通过。真实两章在相同输入下连续生成两次,SHA-256 均为 febe6a847c725b22c95c33d3692bcebdd755325aa2721b6f386c937f4927ff13,HTML 大小 23,648,354 字节。拒绝部分结构错误、支持八类数学夹具;真实书中只出现 6 个数学对象,不能宣称八类都经本书验证。
真实书生成与浏览器402×874 与 3840×2160 视口无页面横向溢出;大屏正文宽 960px,中心为 x=1920px;手机表格有局部横向滚动。打开目录前后正文位置与 scrollY 不变;31 幅图可加载,DOM 中有 2 张表和 6 个原生 math。实际产物,不以夹具截图冒充两章效果。这里只报告已操作的状态;没有宣称全屏、全部锚点、全书逐屏视觉检查均通过。
Gate A 来源六专项未完成正式签核有来源候选、生产观察及对照记录,但没有伪造新哈希的独立六项通过报告。
Gate B 内容七专项未全部完成本轮完成 202 单元候选忠实度对照及定点修改;修改后的全文再审、其他专项尚未全套签核。
Gate D 成品八专项未全部完成浏览器冒烟检查不等于逐对象、逐屏、双视口全量审核。两幅图片例外仍未通过。

为了测生成接口,本轮允许显式 --draft 提前计算候选,页面保留警告。这不是正式的 Gate A→B→C→D 放行流程。投产时,编排器必须把“可以算草稿”与“可以进入下一审核/发布正式版”分开,缺报告、旧哈希、未完成、带未解决问题的 PASS 均不得放行。

根据试跑,我建议这样收紧方案

  1. 保留 BookMD 路线。它解决可重建、可定位和修改边界,不承诺自动解决 OCR 与翻译正确性。
  2. 先定来源所有权,再翻译。图内文字、图题、正文、表格分别归属;打印页码及页眉有明确排除理由。生产流程不能将候选报告的 PASS 当成已应用并复核。
  3. 把应审清单作为独立输入冻结。页域从 PDF 页数/范围派生,文本从来源原子派生;报告只回答这些对象的结果。不要要求模型自己数一遍再以自己的数字为标准。
  4. Spark 继续承担纯文本大吞吐。但必须有校准词表、足够短的上下文单元、独立语义对照;把未译普通英文、量级转换、方位和子图图题作为具体案例。不能用“模型更快”替代验收。
  5. Luna max 做 OCR 和图像对照。复杂曲线/数据点精确关系、反复失败的图或冲突裁决再升级少量 Sol high/xhigh。不要把低清照片的生图误认为无损修复。
  6. 补丁也需要验收。限定单元、固定 before、保留前后差异;修复完整单元回归,模板修改扩大到所有使用该组件的对象。原问题消失不等于修复成功。
  7. 专项任务一次只查一件事。纯文本连续性不看版式;版式管页边界、列表、段距;图像专项只做原图与 HTML 截图的含义对照;数值忠实度不擅自改原书事实。
另外一个容易误修的例子:

原 PDF 第 62 页先出现关于月出时差的段落,再排 Shadowplay;第 63 页才出现 Retardations 标题。本轮直接看原页确认如此,暂保留原顺序。纯文本连续性专项应标为“来源本身的异常”,不能把它当转换错误自动移动;是否编辑原书需另行决定。

证据范围与限制

  • 原书:Peter Grego,The Moon and How to Observe It,2005;本次仅物理 PDF 页 12–68,前后文各一页只作参照。没有现代化改写原书科学内容。
  • 术语核对:香港太空馆亮星英中对照表(Aldebaran=毕宿五);香港天文台:月球天平动;中央大学天文课程月海对照。
  • 本地实测记录:来源组装账本、OCR 修订账本、13 个翻译包、11 个独立忠实度报告及 1 个漏项补查、定点修改记录、图像生成与独立对照记录、生成器测试及浏览器测量。报告内的运行数量来自这些产物,审核通过状态没有从模型自述推断。
  • 此前修订后的完整管线方案 v3描述设计目标;本文描述试跑已实现部分与真实失败。二者用途不同,本文不替代方案,也不是整本书的终审报告。