更新:
通过 Apple 的 Vision 框架在设备端运行 OCR,从 iPhone 上任意一张照片中提取可编辑、可复制的文字,覆盖 14 种语言。Apple 内置的实况文本(Live Text)对来自相机的快速抓取已经处理得不错;ScanLens 的价值出现在以下情况:语言超出实况文本可靠覆盖的范围,照片已经躺在图库里,或者你希望识别出的文字与其他文档一起保存。
要在 iPhone 上从照片扫描文字,先用一款带 OCR 的 App 打开照片,让识别器跑完,再复制、分享或保存提取出来的文字。近年来,Apple 内置了实况文本(Live Text)专门做这件事——在任意照片或相机取景框中长按文字,会出现一个带复制、翻译和分享的选区气泡。如果只是单张快速抓取,这就是合适的工具。
独立 OCR App 变得重要,是在以下三种情况之一成立时:语言超出实况文本支持得较好的范围(CJK 精度、手写、混合文字);照片在相册里放了一段时间,你更想从图库而不是从相机入手;识别文字需要进入文档流——和其他扫描件、PDF 一起保存、可在整个文档库中检索。ScanLens 正是这些场景的答案:由 Apple Vision 提供的设备端 OCR、14 种语言,以及一个能留住结果的文档库。
实况文本是合适的工具,是当文字就在你面前、需要立刻进到剪贴板时。要翻译的路牌、展会上的名片、咖啡馆的 Wi-Fi 密码、路由器背面的型号。打开相机,点一下文字,复制。三秒搞定。实况文本对几十种使用人数很多的语言都处理得不错,翻译也只差一个点击。
ScanLens 真正赢的,是三种很清楚的情况。两周前拍下的日文书页——实况文本能识别日文,但在密集的竖排文本上精度不稳,而结果只会在剪贴板里停留三十秒就被下一次复制覆盖。图库里的印刷信件——对几个月前的旧照片,实况文本有时不会显示选择器,因为它的启发式规则比较保守。一张两种文字并排的照片——双语菜单、俄英对照说明书、日英教科书页。ScanLens 的语言选择器让你能明确告诉引擎要期望什么——这是独立 OCR 一直以来处理混合文档的方式。
就是 Apple 自己在实况文本内部用的那套引擎,直接调用,并能由你来控制语言选择。Vision 可识别 14 种语言,包括主要欧洲语言、西里尔(俄语、乌克兰语)、CJK(简体中文、日文、韩文)、阿拉伯语,以及多种拉丁字母语言的手写。没有任何东西离开设备——照片和识别文字都留在本地。
从"照片"App 取一张,从"文件"App 的文件夹(iCloud 云盘、Dropbox、Google Drive 通过"文件"提供方)导入,或者直接在 ScanLens 内拍一张新的。截图也算——对 OCR 引擎来说就是普通照片——这在你需要从一款不允许直接选中文字的 App 里抓字时很有用。
OCR后,识别文字可复制或通过iOS共享菜单发送。ScanLens可将文档导出为PDF、JPG或PNG;如果需要单独的文字文档,请将复制的文字粘贴到备忘录、Pages、Word或其他编辑器。
这部分是实况文本不会做的。识别文字会作为文档存入 ScanLens,与来源照片关联,并出现在文档库列表中,可与扫描件、PDF 一起被搜索。两个月后,你只记得自己从某家日本餐厅菜单上抓过文字,却不记得是哪张照片,搜索能把它找回来。
从打开 App 到识别文字进入剪贴板,单张照片远不到一分钟。六步,不需要在多个 App 之间来回切换。
| 步骤 | 操作 | 提示 |
|---|---|---|
| 1 | 打开 ScanLens | 从主屏幕或 iOS 程序坞——无需登录 |
| 2 | 导入照片 | "照片"选择器、"文件"浏览、相册或在 App 内重新拍摄 |
| 3 | 选择语言 | 单语种照片用默认设置即可;混合文字时选占大多数的那一种 |
| 4 | 等待 OCR(通常 1–2 秒) | 识别文字会以可编辑覆盖层出现在照片旁 |
| 5 | 选中、复制或分享 | 长按选中;通过 iOS 标准分享菜单发到邮件、信息、备忘录 |
| 6 | 将照片 + 文字保存到文档库 | 作为单个文档保存,可与其他扫描件一起检索 |
截图不过是相册里的一张图片,所以同一套转换照样适用:导入、跑识别、把文字取出来。聊天截图里的一个地址、收据图片上的确认号,或者某个根本不让你选中文字的页面上的一段话——这条路最快。
截图的识别通常比拍下来的纸张更好:文字本来就清晰、受光均匀、四边端正,没有相机带进来的透视变形。唯一的软肋是界面上的小字:字很小的时候,先放大再截图。
Apple 的 Live Text 不用任何 App 就能应付其中不少情况,能用的时候它是最快的选择。它在几种场合下会沉默,知道自己落在哪一种里,能省下时间:
要是 Live Text 给得了你要的东西,那就用它。会去找 App,理由在于掌控:用哪门语言、先怎么处理形状,以及识别出来的文字最后落到哪里。
看不懂的菜单,或者火车站的指示牌。拍下来,跑 OCR,粘贴到翻译器。实况文本已经能处理其中不少;ScanLens 让你自己选语言——西里尔时刻表、日文手写招牌、阿拉伯文标识——并把照片和文字一起留下,方便旅行回来后回看。
图书馆里来不及好好扫描的书页;寄出原件前先拍下的信;朋友的课堂笔记的一页。ScanLens 把照片变成可以引用、检索、粘贴到写作 App 的文字。
站会后白板上潦草的行动项。文档拍摄可校正透视,随后可用白板图像滤镜在 OCR 前改善对比度。手写识别结果仍会受笔迹、语言、光线和拍摄角度影响。
为了一份食谱去扫描整本书并裁边,实在没必要。拍下那一页,对食材和做法跑 OCR,保存到食谱文件夹。文字和照片放在一起——某一步含糊时还能回头看视觉版式。
同事留在你桌上的便利贴;同事发来的白板草图;你自己开会笔记里的一页。Apple Vision 的手写识别覆盖多种拉丁字母语言——专门的说明请见把手写扫成文字。
对于快速抓取——路牌、Wi-Fi 密码、名片——实况文本(Live Text)确实是合适的工具。它内置于近年的 iOS 版本,直接从相机就能用。ScanLens 真正发挥作用,是在以下情况:语言超出实况文本可靠覆盖的范围;照片已经在图库里待了一段时间;或者识别出的文字需要进入一份保存的文档而不仅是剪贴板。
ScanLens 使用 Apple 的 Vision 框架做 OCR,可识别 14 种语言的文字——英语、德语、法语、西班牙语、意大利语、葡萄牙语、荷兰语、波兰语、西里尔(俄语、乌克兰语)、CJK(简体中文、日文、韩文)、阿拉伯语,以及多种拉丁字母语言的手写。请选定与照片相符的那一种语言,让识别器加载对应的模型。
不会。OCR 完全通过 Apple 的 Vision 框架在 iPhone 本机上运行。照片不会为了识别而离开设备。没有 ScanLens 账号,也没有上传步骤。如果之后你把结果保存到 iCloud 云盘文件夹里,那就是 Apple 标准的同步——是你的 iCloud,不是 ScanLens 的服务器。
在语言选择器里指定照片中占大多数文字的那一种语言。遇到中英文混排的菜单或俄英对照的说明书,请从图像里挑出你真正需要的那种文字——告诉识别器该预期哪种语言,正是它不会胡乱猜测的原因,这也在很大程度上解释了人们为什么会选择独立 OCR 而不是实况文本。
可以——在 ScanLens 看来,截图就是一张照片。像导入其他图片一样从相册导入即可。当某个 App 不允许你直接选中文字、需要给视频画面加字幕,或要从聊天截图里抓地址时,这一点尤其有用。
不会。OCR 的输出是纯文本——单词和换行,没有粗体、斜体、字号、颜色、分栏或表格。文字会在你粘贴到的应用里重新排版。如果需要带样式的副本,做法是用 OCR 拿到文字,再用截图或 PDF 保留视觉版式,两者并排留存。
不用注册——这一点是肯定的:ScanLens 在任何环节都不要账号,也不要邮箱,而且没有一步是在别人的服务器上跑的。免费嘛,是一部分:识别会在后台对每一份扫描件运行,在自己的文档里搜索不花钱;而读取、复制、导出识别文字的那个界面,属于付费功能。当前方案在价格页上。