百度开源新OCR模型,长文档识别能力获显著提升
百度近日宣布开源新一代光学字符识别(OCR)模型。该模型的核心突破在于其长文档处理能力,据称能够一次性输入并处理整本书籍级别的文本图像,解决了传统OCR在长文档场景下需要分段处理、容易丢失上下文连贯性的痛点。技术细节显示,模型在复杂版面、密集文字及多语言混合场景下的识别准确率均有显著提升。有消息称,该模型的核心研发人员可能来自知名AI公司DeepSeek的前研究员团队,但此信息尚未得到官方证实。此次开源被视为百度在文档数字化与信息提取领域的一次重要技术释放,有望推动相关应用在金融、法律、教育等行业的落地。