9月5日,矿业巨头紫金矿业发布了一则更正公告,为自家半年报中的三处低级文字错误致歉。
![]()
说来让人啼笑皆非:这份长达266页、净利润高达391.7亿元的半年报里,“墨竹工卡县人民政府”被写成了“墨竹工卡县人民币政府”,“江苏藏青新能源产业发展基金合伙企业”被写成了“江苏藏青新熊源产业发展基金合伙企业”,“青海西宁农村商业银行股份有限公司”则漏掉了“银行”二字。更离谱的是,“人民币政府”这个错误最早可以追溯到2020年年报,六年时间里穿越了两家会计师事务所、两任董秘,愣是没人发现。
![]()
堂堂一家市值数千亿的上市公司,怎么会犯这种连小学生都能看出来的错别字?
![]()
答案几乎可以肯定:又是OCR惹的祸。
做过财报的人都知道,财务报表附注里那些单位名称列表,往往是从往年的报告里直接复制过来的。但原文件年代久远,当年的Word或Excel版本找不到了,新建一个又太麻烦——格式要对齐、边框要一致、字体要统一,光是调表格就能耗掉一下午。于是最省事的办法就出来了:把往年的报告打印出来,或者找到PDF里的截图,用手机扫描App一识别,文字和表格样式一起输出,粘贴到新文档里,齐活。
![]()
OCR(光学字符识别)技术看似方便,实则暗藏陷阱。传统OCR对复杂版面、非标准字体、低分辨率图像的识别能力十分有限。表格结构稍有复杂,识别出来的文字就可能张冠李戴。“人民政府”被识别成“人民币政府”,“新能源”被识别成“新熊源”——字形相近,OCR一不留神就认错了。更关键的是,很多时候明明也从头到尾校对过了,但就是没有看出来。这个时候若校对的第三者也是一眼略过的话,错误也就这么堂而皇之地进了正式文件。
![]()
然而,时代早就变了。
如今识别图片中的文字并按原样式输出,最靠谱的工具早已不是那些风光不再的OCR软件,而是大模型。你把截图丢给AI,它不仅能精准识别文字,还能理解上下文语义——它知道"人民政府"不可能写成"人民币政府","新能源"绝不会是"新熊源"。更重要的是,现在的多模态大模型能直接还原表格结构,输出可编辑的Markdown或Excel,准确率远超传统OCR。
![]()
还有一点至关重要:
识别完之后,务必再用另一个人工智能过一遍全文。 让A模型负责识别和排版,让B模型负责校对和纠错,两个AI互相把关,这种“双盲校验”的成本几乎为零,却能堵住绝大多数低级漏洞。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.