术语对账台 / 跨材料译名一致性核对
材料核对岗 · 待审定清单

术语对账台

将多份中英文材料归集后,核对同一概念在各材料中的用名与释义,输出一份可回溯原文、待人工审定的清单。

核对对象是用名与释义,不评价译文优劣;每条结论只给到「建议 + 依据」,最终审定由人完成。

语料工作区 上传材料,重建本次核对所用的术语对照关系
拖入 PDF / 图片,或点击选择文件
需含「中文名(English)」对照写法 · 单份 ≤ 8 MB · 单批 ≤ 6 份 · 合计 ≤ 24 页
※ 上传文档将交由 TextIn xParse 解析;结果仅用于本次核对,不做落盘存储。请勿上传涉密或含个人隐私的材料。

术语对照表

一行一个英文概念,列出各语料中实际使用的中文写法。判定为「一致」的条目同样保留,用于说明本工具并不会对每一条都报出问题。
英文概念各语料译名出现语料判定

一、译名不一致项(可回溯原文)

按证据强度分两级:译名不一致 —— 至少一侧把该写法用作章节标题,标题即材料对用名的正式表态;同形待查 —— 各写法都只出现在正文,英文同形可能对应两个不同概念(例如「平移」与「偏移参数」都写作 shift),需人工判断,不计入不一致项。本工具只做对齐与定位,不判定应采用哪一个写法。

二、释义并置比对(需人工审定)

同一概念在多份语料中各自给出释义或适用条件,此处并置供比对。两者是否构成矛盾由人判断——这正是核对工作真正耗时之处。

语料清单

全部为可公开引用的材料,来源与许可随语料一并登记。解析范围按需裁剪:教材原书超过单文件上限时只取相关章节。

缩略语核查

仅统计正文元素,排除图片与图注。实测图片内文字会粘连、乱序,不作为术语来源。
缩略语全称各语料出现情况

同名异指

自动扫描:同一中文写法在不同位置对应的英文概念不止一个。
中文写法对应的英文概念

处理流程

  1. 语料入库

    登记来源、许可、语言;教材等大文件先按章节裁剪到单文件上限以内。

  2. 文档解析

    由 TextIn xParse 将 PDF / 图片转为结构化 JSON。xParse 输出:elements(类型 / 坐标 / 页码)、title_tree(标题层级)、table_structure(单元格级)、每页原图 URL

  3. 建立索引

    把每个元素映射到「章节路径 + 页码 + 归一化坐标」,使后续每一条结论都能回溯到原文位置。

  4. 术语锚点提取

    从正文中抽取中英对照(形如「中文名(English)」),并登记每个概念在各语料中实际使用的写法。

  5. 跨源对齐与判定

    按英文概念对齐各语料用名,输出四类:同一概念多译名 / 同名异指 / 释义并置 / 缩略语未定义。

  6. 输出

    术语对照表 CSV、核对报告 Markdown、可点击回溯原文的网页清单。

TextIn xParse 在其中的位置

xParse 只在第 2 步出现,但第 3–6 步全部依赖它的产物:
本作品的能力依赖 xParse 的哪项输出换用普通文本提取会怎样
结论可定位到「第几章」title_tree 的层级与各级页码平铺文本没有章节结构,只能给到页码
可回溯原文并在页面上框出该术语elements 的归一化坐标 + pages 原页图无坐标则无法定位到页面位置
英文双栏论文的术语—释义配对不串行多栏阅读顺序还原左右栏常被交错成一行,配对会直接出错
符号表 / 术语表可被读取table_structure(单元格级 + 跨行跨列)纯文本表格的列关系丢失

判定规则

全部规则公开,可逐条复核。
输出项规则是否需人工审定
同一概念多译名同一英文概念在 ≥2 份语料中对应不同中文写法是
同名异指同一中文写法对应的英文概念 ≥2 个是
释义并置同一概念在 ≥2 份语料中各自给出释义或条件句,并置比对是
缩略语未定义正文出现缩略语且全文未给出其英文全称否,可直接核对
一致各语料用名相同否

已知限制

  • 图片内文字不可用:图表中的文字会粘连、乱序,已被显式排除在术语来源之外。
  • 概念对齐依赖英文锚点:若某材料只出现中文、从未给出英文写法,则无法自动对齐到英文概念,会漏出对齐结果。
  • 是否构成矛盾由人判断:工具只负责把两侧释义并置并指出差异,不下结论。
  • 对齐表受登记口径约束:概念与别名的对应关系经人工核验后写入登记表,判定规则可被任何人复核。本次共登记 11 个概念。