繁简转换不是单字替换。简体里同一个字,在繁体中可能对应多个字形,选错会直接影响阅读。下面列出中文内容站最常出错的 8 组,以及可执行的校对方法。

一简对多繁的高频错误

| 简体 | 常见繁体 | 例子 | |---|---|---| | 发 | 發、髮 | 發展、頭髮 | | 干 | 乾、幹、干 | 乾燥、樹幹、干戈 | | 后 | 後、后 | 以後、王后 | | 复 | 復、複、覆 | 恢復、複雜、覆蓋 | | 台 | 臺、檯、颱、台 | 臺灣、舞臺、檯燈、颱風 | | 历 | 歷、曆 | 歷史、日曆 | | 只 | 只、隻 | 只有、船隻 | | 面 | 面、麵 | 方面、麵條 | | 里 | 里、裡/裏 | 公里、裡面 |

其中「干」最容易出错:表“没有水分”用「乾」,表“事物主体/才干”用「幹」,古语里“盾”义才用「干」。现代内容中,前两者占绝大多数。

软件自动转换为什么会错

转换工具本质上是查表。以 OpenCC 为例,简体转繁体会优先按词组映射(如 “头发→頭髮”),再 fallback 到单字映射(发→發)。问题出在:

  1. 词表覆盖不全。新造词、品牌名、网络用语常未被收录,机器只能按单字转换,把「发」统一成「發」。
  2. 多义字无法只靠上下文判断。例如「天后」既可指歌手名(保持不变),也可指「天上的皇后」(天后),还能是「天空之后」(天後)。机器没有背景知识。
  3. 地区标准不同。台湾多用「裡」,香港多用「裏」;「臺」与「台」在台湾也有混用。若只跑 s2t.json,会丢失地区差异。

参数上,OpenCC 可指定 s2t.json(通用繁体)、s2tw.json(台湾)、s2hk.json(香港)。命令示例:opencc -i in.txt -o out.txt -c s2tw.json。但即便指定地区,仍需要人工二审。

手工校对的检查清单

  1. 全文搜索关键单字:发、干、后、复、台、历、只、面、里,逐条核对语义。
  2. 用固定词组反向验证。例如看到「髮」,检查是否出现在“头髮、髮型、髮色”语境;看到「發」,检查是否为“發展、發表、發生”。
  3. 专有名词不强制转换。人名、地名、机构名、商标按官方写法保留,如「发哥」若为人名则不一定改成「發哥」。
  4. 区分地区目标。台湾读者优先用「裡、臺、麵」;香港读者优先用「裏、枱、麵」。注意「台」在台湾部分场合也通。
  5. 对不确定的字形,使用「通行说法」标注,或在文末加说明,不自己造字。
  6. 定稿前再读一遍标题、小标题和图注,这些地方最容易被自动工具漏掉。

没有工具能一次到位。把自动转换当成“初稿”,再按清单人工扫一遍,就能避开一简对多繁的大多数陷阱。