大模型都能”看图说话”了,OCR还有存在的意义吗
GPT-4V出来之后,我见过一种说法:OCR要被大模型取代了。把一张图片丢给大模型,它能直接读出里面的文字,还能理解意思,比传统OCR强多了,OCR还有什么用?
这个问题值得认真回答,因为它触及了AI技术演进中一个很常见的误区。
大模型确实能读图
这一点没有争议。GPT-4V、Claude、Gemini这类多模态大模型,确实能看懂图片里的文字,而且不只是读出来,还能理解语境、提取关键信息、回答相关问题。
你把一张发票图片丢给它,它能直接告诉你”这张发票的金额是1580元,开票日期是2025年3月,税号是XXX”——这些以前需要OCR+结构化提取两套系统才能做到的事情,大模型一步搞定。
听起来很美。那问题出在哪?
成本:大模型做OCR的代价
大模型处理图片的计算成本,比专用OCR高出几个数量级。
一家银行一天要处理几十万张票据,一家保险公司一天可能要审核十几万份理赔材料,一套出入境管理系统一天要核验几十万本证件——这种规模下,用大模型来做每一个OCR任务,API调用费用和推理时间都是不可接受的。
专用OCR模型的参数量通常在几千万级别,推理一次只需要几十毫秒,单位成本极低。大模型的参数量是几百亿甚至万亿级别,处理一张图片需要几秒钟,成本高出几十倍。
量大、实时、低成本——这三个需求同时出现时,大模型目前还不是答案。
准确率:专用 vs. 通用
大模型是通才,OCR是专才。
在标准格式的证件识别上,专用OCR的准确率可以达到99.8%,而且是稳定可预期的——每次都这样,不会因为模型”状态不好”而波动。
大模型在处理非标准格式、模糊图片时表现更灵活,但在高度结构化的标准格式任务上,并不比专用OCR更准确,有时候反而会”发挥创意”——对识别不清楚的字符进行猜测,而不是报告”不确定”。
对于护照识别这种场景,一个字符识别错了就可能造成身份混淆,容错率接近于零。这种场景需要的不是”八九不离十”,而是”非常准确或明确报错”。
真实的分工是什么样的
实际上,OCR和大模型正在走向融合,而不是相互取代。
OCR负责精准提取,大模型负责理解推理。一份复杂的合同,OCR把所有文字识别出来,再把文本传给大模型,大模型来做风险条款筛查、关键信息提取、合同对比分析——这是目前最常见的企业应用模式。
OCR作为大模型的”眼睛”。一些场景里,大模型需要处理图片信息但主体任务是推理,这时候在大模型前面挂一个OCR做预处理,把图片先转成文本再输入,可以大幅降低成本,同时保证文字识别的准确率。
特定场景各有优势。标准化程度高、量大实时性强的场景(证件识别、票据录入、考卷扫描),专用OCR是主力;复杂非结构化场景(理解手写信件、分析图文混排文档、处理方言手写体),大模型的灵活性更有价值。
OCR的护城河在哪里
当一项技术二三十年后还在被广泛应用,通常说明它解决了某个特别顽固的需求。
OCR的核心价值是:把非结构化的图像信息转化成结构化的可计算数据,速度快,成本低,准确率高且稳定。这个需求在数字化的各个角落都存在,不会消失。
大模型的出现让OCR变得”没那么独特”,但也让OCR有机会站在更大的AI系统里发挥更重要的作用。
两者不是替代关系,而是一个新的组合正在形成。
更多推荐


所有评论(0)