thiagotigaz/ocr-it · 上手攻略
- 仓库:thiagotigaz/ocr-it
- 链接:https://github.com/thiagotigaz/ocr-it
- 分类:工具 · 浏览器扩展
- 作者:Tom
- 更新:2026-08-26
是什么
OCR It 是一款 Chrome / Firefox 浏览器扩展,解决一个具体问题:无法选文字的扫描文档、PDF 阅读器、幻灯片网页,用一次快捷键把页面截图 OCR 成文本。它的核心特性是本地离线 OCR——内置 Tesseract 引擎,截图片段完全在本地处理,扩展本身不发出任何网络请求,不调用任何云端 API。适合扫了整本纸质书或 PDF 后想提取全文喂给 LLM 整理的用户。
解决什么问题
当你遇到以下场景时,传统做法是手动抄录或付费 OCR API: - 学校图书馆的扫描版教材,无法复制文字 - 幻灯片网站只读模式,无法下载 - PDF 嵌入在网页阅读器里,禁止文字选择 - 老报纸、老论文影印版的数字化
OCR It 把这个流程压缩成两步:拖选一次区域 → 按快捷键逐页抓取,不需要 API key,不需要联网,不产生任何费用。
快速安装
Chrome(推荐,从商店装)
直接访问 Chrome Web Store · OCR It,点击安装,自动更新。
Chrome(开发者模式加载源码)
git clone https://github.com/thiagotigaz/ocr-it.git
cd ocr-it
# 不需要 npm run build,源码直接可用
# 打开 chrome://extensions → 开启开发者模式
# → "加载已解压的扩展程序" → 选 ocr-it 目录
# → 在工具栏固定图标
# → 检查 chrome://extensions/shortcuts 确认快捷键已注册
Firefox(临时加载,正式版等待 Mozilla 审核)
# 从 GitHub Releases 下载最新 zip
# 打开 about:debugging#/runtime/this-firefox
# → "临时加载附加组件" → 选择 ocr-it-firefox-*.zip
# 注意:Firefox 退出后临时附加组件自动卸载,需重新加载
⚠️ Firefox 永久安装:Mozilla 审核通过后从 addons.mozilla.org 安装,审核进度见 GitHub Releases。
核心用法
手动逐页抓取
- 打开文档页面
- 按
Alt+Shift+R绘制选区(文字区域,边距留一点),按 Enter 确认 - 按
Alt+Shift+S截取当前页,OCR 结果追加到面板 - 手动翻页,重复第 3 步
- 面板内可编辑单页文本、可复制全部、可下载
.txt
全自动连续抓取(自动翻页)
- 先用
Alt+Shift+R画好选区 - 打开扩展弹窗,点击 Pick control,再点击文档的"下一页"按钮(存储的是坐标点,不是 CSS 选择器,DOM 重渲染后仍有效)
- 可选:设置翻页键盘快捷键(默认发送
ArrowRight到 iframe) - 点击 Test now 测试翻页是否正常
- 按
Alt+Shift+A开始自动运行:抓图→OCR→翻页→重复,直到按 Esc 停止
核心技术机制
- Tesseract OCR:内置在扩展包里,完整离线运行,版本随扩展更新
- 跨域 iframe 支持:大多数嵌入式阅读器在 iframe 里,扩展通过 postMessage 把坐标传递给跨域父帧,找到实际拥有该坐标的帧并向其发送键盘事件
- Shadow DOM 支持:坐标点查询方式不依赖 CSS 选择器,能穿透 Shadow DOM(
document.querySelector无法到达的地方) - 页面计数器:工具栏图标徽章显示待处理队列数,抓取后自动更新
权限说明
- 安装时不申请任何站点权限
- 单次抓取走
activeTab临时权限,触发时由浏览器临时授权 - 自动运行(跨页面保持)和 iframe 内翻页需要持久权限,扩展弹窗有 Allow 按钮申请当前站点
典型适用场景
| 场景 | 体验 |
|---|---|
| 扫描版教材整本提取 | 画一次区域 + 自动翻页,300 页约 30 分钟(取决于 CPU),结果可喂给 Claude 做问答/摘要 |
| 幻灯片逐页文字提取 | 手动逐页 Alt+Shift+S,配合截图留存 |
| 图书馆古籍数字化 | 竖排文字、古体字可切换 Tesseract 语言包(需自行下载) |
| 网页 PDF Reader 禁止复制 | 与大多数主流 PDF 在线阅读器兼容,包括嵌入 iframe 的场景 |
坑与注意
-
快捷键冲突:Chrome 有时会静默忽略与其他扩展冲突的快捷键。装完要去
chrome://extensions/shortcuts确认三个快捷键(Alt+Shift+S/A/R)都显示出来了,若空白说明被占用,换一个扩展的快捷键。 -
Firefox 临时加载每次重启失效:这是 Firefox 对未签名附加组件的安全限制,无法绕开。长期使用等 Mozilla 审核通过,或换 Chrome。
-
自动翻页依赖坐标点:如果文档布局变化(如双栏变单栏),之前存储的"下一页按钮"坐标可能偏离,需要重新 Pick。
-
选区要覆盖整个文字区域:选区外的文字不会被 OCR,包括页眉页脚;选区可以稍大不要稍小,OCR 会自动识别。
-
图片质量影响 OCR 准确率:200 DPI 以上的扫描件效果最好;低分辨率截图(如手机拍屏幕)Tesseract 误识率明显上升。
-
语言包:默认 Tesseract 支持英文。中文、日文等语言包需要自行下载并放到扩展目录(扩展内置 Tesseract 版本可能不支持额外语言包,⚠️ 需实测确认)。
-
性能:每页 OCR 在后台异步执行,不会卡住浏览器;但大批量(100 页以上)建议分段处理,避免标签页内存积累。
与同类对比
| 工具 | 离线 | 免费 | 自动翻页 | 跨域 iframe | 适用平台 |
|---|---|---|---|---|---|
| OCR It(本工具) | ✅ | ✅ | ✅ | ✅ | Chrome / Firefox |
| Adobe Acrobat Pro OCR | ❌(订阅制) | ❌ | ✅ | N/A(桌面软件) | Windows / Mac |
| Google Keep(网页截图 OCR) | ❌ | ✅ | ❌ | ❌ | 全平台 |
| 在线 OCR(iLovePDF 等) | ❌ | 部分免费 | ❌ | ❌ | 浏览器 |
| Tesseract CLI | ✅ | ✅ | ❌ | ❌ | 命令行 |
核心差异:OCR It 是唯一同时满足「离线 + 免费 + 自动翻页 + 跨域 iframe」的浏览器扩展。其他方案要么需要联网,要么是桌面软件无法对接网页阅读器。
一句话推荐结论
需要从网页版扫描文档里提取文字、又不想折腾 API 或桌面软件?OCR It 是目前最顺手的浏览器扩展方案,免费、本地运行、自动翻页,Alt+Shift 三快捷键搞定全流程。