OCR 文字识别
支持本地浏览器识别与 Gemini AI 高精度识别模式
本地与云端混合处理
极速且高效
开发者专属
核心处理可能在浏览器本地完成,但可选的联网或 AI 功能会传输生成结果所需的输入。 查看数据处理详情。
隐私声明
标准模式识别完全在您的浏览器本地完成,图片不会上传。AI 增强模式下图片将安全传输至 Google Gemini 进行处理。
点击或拖拽上传图片
支持 JPG, PNG, WebP (最大 10 MB)
识别结果
未检测到文字内容
如何使用 OCR 文字识别?
- 1点击上传区域选择需要识别的图片或直接将图片拖入。
- 2在设置中选择识别语言(默认为中英文混合)。
- 3选择识别模式:标准模式速度快且保护隐私;AI 模式精度更高,支持复杂排版。
- 4点击“开始识别”,等待处理完成后即可查看并复制文字。
OCR 相关问题
标准模式和 AI 增强模式有什么区别?
标准模式基于 Tesseract.js 在本地浏览器运行,不上传图片,适合清晰简单的文字;AI 增强模式调用 Gemini 2.0,对倾斜、手写或复杂背景识别率更高。
支持哪些图片格式?
目前支持主流的 JPG, PNG 和 WebP 格式图片。
识别结果出现乱码怎么办?
如果识别结果不理想,建议切换到“AI 增强模式”。标准模式对图片质量要求较高,而 AI 模式能更好地处理复杂背景、手写体或营业执照等证件。
常用使用场景
- 文档数字化:快速将纸质文件拍照并转为可编辑文字。
- 截图转文本:将网页截图、代码报错或视频字幕一键提取。
- 智能翻译:结合 AI 模式,直接识别并翻译图片中的多国语言内容。
- 信息提取:识别名片、发票、快递单等结构化信息。
技术原理解析
本工具采用本地与云端双模式。标准模式在加载 Tesseract.js 引擎资源后于浏览器中识别;AI 模式会把图片发送给云端多模态模型处理。