生活中的AI · 原创
腾讯开源了个"拍照提取文字"的模型,1B参数就能跑在你笔记本上
拍合同、扫发票、翻译路牌、提取截图文字——这个OCR大模型把"扫一扫转文字"做到了开源第一。
你手机里那个"扫一扫转文字",背后是个叫OCR的技术。合同扫描、发票识别、古籍数字化、翻译外文路牌、把手写笔记变成电子版——全靠它。但以前这套东西很碎:表格识别要一个模型、手写要一个、印章检测又一个、多语言再来一个,企业部署一套得养七八个模型。腾讯混元最近开源的 HyOCR-1.5,想把这摊子事用一个模型收拾利索。
一、它强在哪
端到端:扔一张图进去,直接出结果,省掉了传统的"先分析版面、再识别文字"那堆预处理,误差不会一层层累积。
又小又猛:只有1B(10亿)参数,却在 OCR 最权威的榜单 OmniDocBench 上拿了94.74分、端到端第一,比很多闭源商业方案还高。引入一个叫 DFlash 的加速框架后,推理速度提升6.37倍,处理一页文档只要1.4秒左右。
全能:支持100多种语言、4K分辨率、12.8万字的超长上下文——一张超大表格扔进去,它能从头看到尾不漏细节。
全栈开源:训练方法、推理代码、模型权重全公开。重点是,它够轻,能跑在CPU、消费级显卡、普通笔记本上,甚至将来可能跑手机。大公司才能玩的OCR,现在个人电脑就能本地跑。
二、跟你有啥关系
最直接的:手机拍张纸,文字直接提取出来——扫合同、扫发票、翻译路牌、提取截图里的文字,都不用再手动敲。而且因为能本地运行,敏感的合同、证件不上传云端,隐私更稳。开发者也能自己部署、二次开发,接进自己的小程序或工具里。
三、一句话总结
OCR 是 AI 落地"最后一公里"的桥。腾讯这次把它做成了又小、又快、又开源、还能跑在咱自己电脑上的东西——技术真的开始飞入寻常百姓家了。
相关文章
国产开源大模型「月底三连炸」:Kimi K3、通义 3.8-Max、DeepSeek V4 集体放大招
一周之内,Kimi K3、通义 3.8-Max、DeepSeek V4 三款国产开源大模型相继放大招,参数规模纷纷突破 2 万亿。
宇树王兴兴登《时代》封面:10 年内每个家庭或许都将拥有一台机器人
宇树王兴兴与 GD01 载人机甲同登《时代》封面,预言 10 年内每个家庭或拥有一台机器人;摩根士丹利预测 2050 年全球 10 亿台。
微信里多了一双绿色眼睛:动动嘴就能点咖啡、发红包、总结群聊
微信正在内测原生 AI 助手"小微":绿色眼睛入口、调小程序办事、群聊总结、零代码做小工具,付款必须手动确认。