OCR从”字幕组”到大模型——四十年识字进化史
有一类工作,二十年前需要整屋子的工程师,今天一块芯片就能搞定。
这就是OCR——光学字符识别,简单说就是让机器看懂文字。你以为这是个新技术?错了,它比大多数人以为的要老得多。
从邮件分拣开始
OCR真正大规模应用,是从1950年代美国邮政系统开始的。那时候,邮局要人工看信封上的地址,再分到对应的格子里,效率极低。工程师们想:能不能让机器读地址?
这个想法推动了最早的OCR系统诞生。那时候的方案叫”模板匹配”——把每个字母的形状存进系统,来一封信,机器就对着模板逐个比对,像是在玩”找不同”。它能认识标准印刷体,但只要字体稍微变形,就彻底抓瞎。
规则时代:靠人类给机器立规矩
1980到2000年代,OCR进入”规则时代”。这时候的主流思路是:让工程师把汉字的所有书写规律写成代码,然后机器按规则识别。
这条路走得很辛苦。汉字有7000多个常用字,每个字的笔画、结构、变体都不一样,光是把规则写全就是一项几十人耗费数年的工程。那时候OCR的准确率大概在92%到95%之间,看起来不错,但放到实际使用里,每100个字错4、5个,一份合同下来就是灾难。
这个时期有一个代表性的技术产品叫TH-OCR,是清华大学研究团队研发的,专攻中文识别,一度是国内最好的中文OCR引擎之一,后来被不少软件授权使用,包括微软Office。
深度学习来了,规则被扔掉了
2012年以后,深度学习改变了这一切。
以前工程师写规则告诉机器”这个字长这样”,现在的思路完全反过来:给机器几百万张标注好的文字图片,让它自己去总结规律。
CRNN(卷积循环神经网络)是这一时期OCR的主力技术。它先用卷积层”看”图片的特征,再用循环层处理文字序列,最后输出识别结果。这种架构的特点是:不需要预先分割每个字,直接处理整行文字,对变形、污损、斜体的容忍度大幅提升。
准确率也因此从95%一路提升到99%以上。
大模型进来之后,OCR不只是”认字”了
最近几年,Transformer架构和大语言模型的出现,让OCR又升了一个维度。
传统OCR只管认字,认完了就结束。但实际使用里,”认字”往往只是第一步——你还需要理解这些字的含义,提取出关键信息。
现在的做法是把OCR和语言模型结合起来:OCR先把图片里的文字读出来,语言模型再来理解语义、提取结构化信息。比如一份合同,OCR读出所有文字,语言模型自动找出甲方、乙方、金额、日期,直接输出成表格。
更进一步的是”端到端多模态”方案——图片直接进去,结构化数据直接出来,中间那道OCR的门都省了。GPT-4V、Claude、Gemini这类多模态大模型已经可以直接读懂图片里的文字,不需要单独的OCR模块。
但OCR还没有被大模型取代
你可能会问:既然大模型直接看图就行,OCR是不是快被淘汰了?
还早。
大模型处理图片的成本比专用OCR高得多,速度也慢,对于每天要处理数百万份单据的金融机构、政务系统来说,成本不可接受。
专用OCR在特定场景的准确率也不输大模型——比如护照机读区的标准字体,OCR做到99.8%的准确率,大模型未必能稳定达到这个数字。
更现实的情况是:OCR和大模型已经开始融合。OCR负责精准快速的文字提取,大模型负责理解和推理,两者分工合作。
从1950年代的邮件分拣机,到今天处理数亿份证件的识别系统——这四十年,这个看起来不起眼的技术,一直在安静地进化。
更多推荐


所有评论(0)