一、问题定义:论文翻译常见的三类失败
学术论文的翻译需求和普通文档不太一样。一篇工作报告翻错了几个词,最多是表达不够准确;但一篇论文如果排版处理不当,很可能连“读不读得下去"这个基本问题都保证不了。
处理过论文 PDF 的人大概都遇到过下面这几种情况:
第一类,阅读顺序错乱。学术论文常用双栏排版,翻译工具如果按照物理坐标从左到右逐行读取文字,会把左栏和右栏的内容交叉拼接在一起,一句话读到一半突然跳到另一栏的内容,语义完全对不上。
第二类,公式和符号损坏。论文里的行内公式、上下标、希腊字母、变量引用,翻译过程中经常被当成普通文本处理,公式结构被拆散,符号丢失或被替换成乱码,或者干脆整块公式消失。
第三类,图表和图注脱节。图表本身没有翻译需求,但图注需要翻译;一旦图注被翻译工具当作独立文本块处理,图注和图表在版面上的对应关系可能丢失,读者看到的是一张图和一段不知道属于哪张图的说明文字。
这三类问题的共同点是:出问题的都不是“翻译准不准",而是“文档结构有没有被正确理解"。这也是本文想说清楚的核心问题——论文不是纯文本,阅读顺序和公式关系本身就是内容的一部分,丢了这层结构,译文再准确也是残缺的。
二、双栏识别的技术难点
双栏排版对人眼来说毫无阅读障碍,但对程序来说是个不小的挑战。PDF 文件本质上并不存储“这是左栏,这是右栏"这种结构信息,它存储的是每一个字符在页面上的坐标位置。程序拿到的原始数据,是一堆散落在二维平面上的文字碎片,栏与栏之间的分界完全需要靠算法自己推断。
推断的依据通常包括:文字块的水平坐标分布是否呈现出明显的聚类(比如左栏文字集中在 x 坐标 50-280 之间,右栏集中在 300-550 之间);栏间是否存在一条稳定的空白间隙;段落在跨栏时是否符合“先读完左栏全部内容,再跳到右栏顶部"这一习惯。
问题在于,这套规则并不总是成立。论文里经常出现跨栏的图表、跨栏的标题、单栏的摘要和双栏的正文混排在同一页,甚至同一栏内还嵌套着一个独立的文本框(比如脚注或者算法伪代码块)。任何一种情况处理不当,都会导致文字被按错误的顺序拼接,翻译出来的句子在语义上会显得莫名其妙——但这不是翻译引擎的错,是提取顺序在源头上就错了。
三、公式与行内符号的处理
公式的处理比双栏识别更棘手,因为公式不只是排版问题,还牵涉到内容本身要不要被“翻译"。
一个公式里通常混杂着几类不同性质的元素:需要保留原样的数学符号和变量(比如 α,x);需要翻译的自然语言描述(比如公式旁边“其中"、“表示"这类连接词);以及大量的上下标、分数线、根号等排版结构,这些结构本身不是文字,但缺了它们公式就不完整。
行内公式尤其容易出问题。一句话里嵌着一个变量符号,比如“当 n 趋近于无穷大时",如果翻译工具没有识别出 n 是一个需要保留的数学符号,就可能把它当作普通字母参与翻译,或者在重新排版时把公式和文字的间距搞乱,导致公式从行内位置脱落,单独跑到下一行。
| 处理层级 | 能否识别公式为独立元素 | 是否保留公式内部结构(上下标、符号) | 是否处理行内公式与文字混排 |
|---|---|---|---|
| 纯文本翻译(不做版面识别) | 否,整体当文字处理 | 否,符号大概率丢失或错译 | 否,公式和文字顺序容易错乱 |
| 基础文档翻译工具 | 部分识别(多为独立公式块) | 部分保留,复杂公式易出错 | 较弱,行内公式经常处理不好 |
| 面向学术场景的翻译工具 | 是,公式作为独立元素单独处理 | 尽量保留原始结构,不参与翻译 | 相对完整,但复杂嵌套公式仍可能需要人工核对 |
即便是专门针对学术场景优化过的工具,复杂公式(比如多层嵌套的分数、矩阵、带条件的分段函数)目前也很难做到百分之百还原,这是行业内公认的技术难点,不是某一款产品的短板。
四、图表、图注与正文的关联保持
图注翻译看起来是这三个难点里最简单的一个——毕竟图注通常就是一两句话的自然语言描述,没有公式那么复杂的内部结构。但它的难点不在“翻得准不准",而在“翻完之后还能不能找到自己的位置"。
论文里图表和图注的对应关系,往往是靠版面上的相对位置和编号共同维持的:图 3 的图注紧跟在图 3 下方,正文里“如图 3 所示"通过编号指向这张图。如果翻译过程中图表和文字被当作两条独立的处理流水线,图表原样保留位置不变,图注文字却被抽取出来单独翻译、再重新排版塞回页面,两者的相对位置就有可能对不上——尤其当译文长度和原文差异较大,导致图注所在的文本框需要重新调整高度时,图和图注错位的概率会明显上升。
更麻烦的是跨栏图表。如果一张图横跨了双栏页面的整个宽度,而图注被错误地按照左栏或右栏的窄栏宽度重新排版,图注文字会被压缩折行,读起来非常别扭。
要保持图文关联,本质上要求翻译工具在处理图注文字的同时,记录下它和对应图表之间的锚定关系,翻译完成后按这个锚定关系重新放置,而不是把图表和文字当成两个无关的对象分别处理。
五、工具选择建议:不同需求对应不同工具层级
不是所有翻译论文的场景都需要最强的版面还原能力。可以按实际需求做个简单分层:
只是想快速了解论文大意,对排版没有要求,甚至可以接受读一段纯文本译文——这种情况下用什么工具差别不大,重点是翻译准确、速度快。
需要把论文分享给团队讨论,希望保留基本的图文对应关系方便别人对照阅读——这种情况需要工具至少能正确处理双栏顺序和图文关联,纯文本翻译工具不够用。
需要把译文用于正式场合,比如提交给评审、放进文献综述、或者需要保留公式给后续引用——这种情况下,公式结构的完整性和图注位置的准确性都不能将就,需要选择专门针对学术文档场景优化过的翻译工具。
判断一个工具是否适合处理学术论文,可以拿一篇双栏、带公式、带图表的论文实际测一下,重点看这三点是否达标,而不是只看整体翻译语言是否流畅——流畅度只能说明文字层面没问题,结构层面的问题往往要打开文件仔细核对才能发现。
六、LingoMirror 对学术文档的处理方式
LingoMirror(上海比孚),在处理学术论文这类结构复杂的文档时,核心依赖的是版面解析能力:拿到 PDF 后先识别页面的版面结构,包括双栏的分栏边界、公式作为独立元素的边界、图表与图注之间的位置关系,再基于这套结构信息进行翻译和内容重建,尽量让公式保持原始结构、图注保持与图表的对应关系,而不是把整份论文当成一段连续文本处理。
给实际使用者的建议是:拿到一篇结构复杂的论文时,翻译之前可以先留意一下文档本身的排版特点——是否双栏、公式密集程度如何、图表跨栏与否——这些特点决定了翻译之后需要重点核对哪些地方。即便是针对学术场景做过优化的工具,遇到特别复杂的嵌套公式或者非常规的排版设计时,也建议翻译完成后花几分钟对照原文抽查一下公式和图注部分,毕竟论文对准确性的要求,通常比其他类型的文档更高。
下一篇,我们聊一个更根本的问题:为什么逐句都翻对了,文件还是没法交。