返回首页AI热点速递

腾讯开源了个“拍照提取文字”的模型,1B参数就能跑在你笔记本上

腾讯混元HyOCR-1.5:1B参数端到端OCR,OmniDocBench 94.74分第一,能本地跑不上传云端

2026年07月20日 2 分钟阅读 125

生活中的AI · 原创

腾讯开源了个"拍照提取文字"的模型,1B参数就能跑在你笔记本上

拍合同、扫发票、翻译路牌、提取截图文字——这个OCR大模型把"扫一扫转文字"做到了开源第一。

你手机里那个"扫一扫转文字",背后是个叫OCR的技术。合同扫描、发票识别、古籍数字化、翻译外文路牌、把手写笔记变成电子版——全靠它。但以前这套东西很碎:表格识别要一个模型、手写要一个、印章检测又一个、多语言再来一个,企业部署一套得养七八个模型。腾讯混元最近开源的 HyOCR-1.5,想把这摊子事用一个模型收拾利索。

一、它强在哪

端到端:扔一张图进去,直接出结果,省掉了传统的"先分析版面、再识别文字"那堆预处理,误差不会一层层累积。

又小又猛:只有1B(10亿)参数,却在 OCR 最权威的榜单 OmniDocBench 上拿了94.74分、端到端第一,比很多闭源商业方案还高。引入一个叫 DFlash 的加速框架后,推理速度提升6.37倍,处理一页文档只要1.4秒左右。

全能:支持100多种语言、4K分辨率、12.8万字的超长上下文——一张超大表格扔进去,它能从头看到尾不漏细节。

全栈开源:训练方法、推理代码、模型权重全公开。重点是,它够轻,能跑在CPU、消费级显卡、普通笔记本上,甚至将来可能跑手机。大公司才能玩的OCR,现在个人电脑就能本地跑。

二、跟你有啥关系

最直接的:手机拍张纸,文字直接提取出来——扫合同、扫发票、翻译路牌、提取截图里的文字,都不用再手动敲。而且因为能本地运行,敏感的合同、证件不上传云端,隐私更稳。开发者也能自己部署、二次开发,接进自己的小程序或工具里。

三、一句话总结

OCR 是 AI 落地"最后一公里"的桥。腾讯这次把它做成了又小、又快、又开源、还能跑在咱自己电脑上的东西——技术真的开始飞入寻常百姓家了。