2025年10月20日DeepSeek发布新模型DeepSeek-OCR

该模型采用“上下文光学压缩”技术,将传统AI逐词处理文本的方式转变为直接通过图像分析信息。

在信息处理阶段,模型不再依赖Token序列转换,而是将内容压缩为图像进行视觉编码,实现并行处理。

这种方式显著提升了超长文本的吞吐效率,计算复杂度由N的平方降低,解决了当前AI因上下文过长而中断对话的问题。

模型仅以文本形式存储最近10轮对话,更早的记录则被渲染成图像并编码存储。

当需要调用历史信息时,解码器会读取相应图像内容,解析后返回结果。

对于长期未使用的信息,系统会进一步压缩为更小图像,模拟人类记忆随时间衰退的特性。

这一机制既降低算力消耗,又提升信息处理效率和结构化输出能力。

https://www.donews.com/news/detail/4/6205715.html

DeepSeek OCR 就是一个“超级视力+超级大脑”的组合,专门用来把图片里的文字“认出来”,并且“敲”成电脑可以编辑和处理的文本。


拆解“DeepSeek OCR”这个名字

  1. DeepSeek(深度求索):这是公司的名字,代表这项技术背后有非常厉害的人工智能(AI)。

  2. OCR:这是核心技术的缩写,全称是“光学字符识别”。

    • 光学:指的就是“看”,处理的是图片、扫描件这类视觉信息。

    • 字符:指的就是文字,比如中文、英文、数字、标点等。

    • 识别:指的就是“认识、辨别、理解”。

所以,合起来就是:深度求索公司开发的、用人工智能技术来识别图片中文字的工具。


它具体是怎么工作的?(三步走)

  1. “找”文字:首先,它会像侦探一样,在图片里扫描,找到所有“看起来像文字”的区域。比如,它会发现图片里有一大段报纸文章,或者一个路牌。

  2. “认”文字:找到文字区域后,它就开始一个字一个字地“读”。这个过程非常厉害,因为它不是简单地比对模板,而是像一个受过大量训练的人一样,能认出各种不同的字体、大小、颜色,甚至能处理一些模糊、倾斜、有背景干扰的“不完美”图片。

  3. “输出”文字:最后,它把识别出来的文字,转换成我们可以复制、粘贴、搜索、编辑的电子文本(比如TXT或Word文档)。


它有什么用?(生活和工作场景)

你很可能已经在不知不觉中使用过OCR技术了:

  • 手机拍照翻译:用手机拍下外文菜单,APP上直接显示中文——第一步就是OCR识别出了外文。

  • 扫描软件:用“扫描全能王”等APP拍纸质文件,生成清晰的PDF,并且可以搜索里面的文字。

  • 银行卡绑定:用支付宝或微信绑定银行卡时,用摄像头对准银行卡,它能自动识别出卡号,不用你手动输入。

  • 停车场/收费站:自动识别车牌号。

  • 办公自动化:把一堆纸质合同、发票扫描成图片,然后用OCR批量转换成Excel或Word,进行数据统计和存档。


总结:DeepSeek OCR 的核心优势

相比于传统的OCR技术,DeepSeek OCR 因为融入了先进的深度学习AI,所以它:

  • 更聪明:识别准确率更高,尤其对复杂版面和手写体(在一定清晰度下)效果更好。

  • 更强大:能处理各种“刁难”的场景,比如文字倾斜、光线不均等。

  • 更全能:通常支持多种语言混合识别,表格识别等复杂任务。

总而言之,DeepSeek OCR 就是一个能帮你把“死”图片里的文字“救活”,变成“活”的电子文本的AI神器!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐