将多份中英文材料归集后,核对同一概念在各材料中的用名与释义,输出一份可回溯原文、待人工审定的清单。
核对对象是用名与释义,不评价译文优劣;每条结论只给到「建议 + 依据」,最终审定由人完成。
| 英文概念 | 各语料译名 | 出现语料 | 判定 |
|---|
| 缩略语 | 全称 | 各语料出现情况 |
|---|
| 中文写法 | 对应的英文概念 |
|---|
登记来源、许可、语言;教材等大文件先按章节裁剪到单文件上限以内。
由 TextIn xParse 将 PDF / 图片转为结构化 JSON。xParse 输出:elements(类型 / 坐标 / 页码)、title_tree(标题层级)、table_structure(单元格级)、每页原图 URL
把每个元素映射到「章节路径 + 页码 + 归一化坐标」,使后续每一条结论都能回溯到原文位置。
从正文中抽取中英对照(形如「中文名(English)」),并登记每个概念在各语料中实际使用的写法。
按英文概念对齐各语料用名,输出四类:同一概念多译名 / 同名异指 / 释义并置 / 缩略语未定义。
术语对照表 CSV、核对报告 Markdown、可点击回溯原文的网页清单。
| 本作品的能力 | 依赖 xParse 的哪项输出 | 换用普通文本提取会怎样 |
|---|---|---|
| 结论可定位到「第几章」 | title_tree 的层级与各级页码 | 平铺文本没有章节结构,只能给到页码 |
| 可回溯原文并在页面上框出该术语 | elements 的归一化坐标 + pages 原页图 | 无坐标则无法定位到页面位置 |
| 英文双栏论文的术语—释义配对不串行 | 多栏阅读顺序还原 | 左右栏常被交错成一行,配对会直接出错 |
| 符号表 / 术语表可被读取 | table_structure(单元格级 + 跨行跨列) | 纯文本表格的列关系丢失 |
| 输出项 | 规则 | 是否需人工审定 |
|---|---|---|
| 同一概念多译名 | 同一英文概念在 ≥2 份语料中对应不同中文写法 | 是 |
| 同名异指 | 同一中文写法对应的英文概念 ≥2 个 | 是 |
| 释义并置 | 同一概念在 ≥2 份语料中各自给出释义或条件句,并置比对 | 是 |
| 缩略语未定义 | 正文出现缩略语且全文未给出其英文全称 | 否,可直接核对 |
| 一致 | 各语料用名相同 | 否 |