在今天的Unicode字符集里,藏着一群身份成谜的“幽灵汉字”(日文称“幽霊文字”)。它们不是网络生造字,也不是罕见的古籍异体字,而是1978年日本JIS X 0208标准制定时意外产生的编码错误。 当年标准制定者从大量资料中收集汉字,依靠人工抄录与整理,难免出现字形辨认失误、出处记录混乱甚至来源彻底遗失的情况。这些“查无实据”的汉字被编入标准后,又随着字符集兼容进入Unicode,从此成为现代数字文本中的永久住客。 许多幽灵字符没有可考读音,也找不到真实文献用例,却在电脑和手机里安静地存在了四十多年。Unicode的收录原则本是“为所有真实文字提供数字身份”,而幽灵字符的存在,恰恰打破了这种理想叙事:它们既是技术史上的意外产物,也是标准系统“不完美”的活证据。 研究者至今仍在回溯档案,试图为这些汉字找到真正来源,而一些字符恐怕永远只能保持“幽灵”身份。这段编码史提醒我们:所谓标准,有时不过是人类错误被制度化后的漫长回声。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.