跳到主要内容

基础OCR

从图片里认出文字或表格。公式请用 公式识别

当前模块定义

sys:basic-ocr网络服务Action
标准模块
输入 11 · 输出 5 · 枚举 6

输入参数

  • 接口/引擎operationEnum必填

    OCR接口或引擎。离线引擎安装方式请参考模块文档。

    填写 固定输入默认 QuickerServerOcr
    7 个选项Quicker OCR引擎、Windows10/11 内置OCR引擎、百度通用文字识别(自定义帐号)
    Quicker OCR引擎默认QuickerServerOcr
    Windows10/11 内置OCR引擎WindowsOcr
    百度通用文字识别(自定义帐号)baidu-basic
    百度通用文字识别(Quicker帐号)baidu-quicker
    百度自定义接口识别(自定义帐号)baidu-custom
    表格识别(Quicker服务)table_quicker
    本地 OCR(中英)LocalOcr
  • ApiKeyapiKeyText必填

    请填写OCR帐号的ApiKey

    填写 输入或变量条件 仅:baidu-basic, baidu-custom
  • SecretKeysecretKeyText必填

    请填写OCR帐号的SecretKey

    填写 输入或变量条件 仅:baidu-basic, baidu-custom
  • 图片变量imgVarImage必填

    从指定变量中加载图片

    填写 仅变量
  • 转换标点符号punctuationTypeEnum必填

    合并文本时,是否转换标点符号

    填写 输入或变量条件 仅:baidu-basic, baidu-quicker, QuickerServerOcr默认 no
    不转换默认no
    全角符号sbc
    半角符号dbc
  • 合并段落mergeChapterEnum必填

    是否智能合并段落。

    填写 输入或变量条件 仅:baidu-basic, baidu-quicker, QuickerServerOcr默认 no
    不合并默认no
    合并merge
  • 接口名称或网址interfaceText可选

    接口的完整网址,或 https://aip.baidubce.com/rest/2.0/ocr/v1/ 后面的部分

    填写 输入或变量条件 仅:baidu-custom
    9 个选项通用文字识别(标准版)、通用文字识别(标准含位置版)、通用文字识别(高精度版)
    通用文字识别(标准版)general_basic
    通用文字识别(标准含位置版)general
    通用文字识别(高精度版)accurate_basic
    通用文字识别(高精度含位置版)accurate
    手写文字识别handwriting
    数字识别numbers
    办公文档识别doc_analysis_office
    表格文字识别(同步接口form
    二维码识别qrcode
  • 附加参数optionsDict可选

    请参考百度官方/Quicker服务接口说明。每行一个参数,使用option:value的格式。

    填写 输入或变量条件 仅:baidu-custom
  • 语言langText可选

    待识别内容的语言。表格识别仅支持中英混合和英文。

    填写 输入或变量条件 仅:QuickerServerOcr, table_quicker
    7 个选项中英混合、英语、韩语
    中英混合CHN_ENG
    英语ENG
    韩语KOR
    日语JAP
    繁体中文CHT
    拉丁语LAT
    阿拉伯语ARA
  • 离线模式offlineModeEnum可选

    旧版兼容参数。Quicker OCR 当前固定使用在线服务;旧动作选择“仅使用离线引擎”时转为本地 OCR。新动作请直接选择“本地 OCR(中英)”。

    填写 固定输入条件 仅:QuickerServerOcr默认 Auto
    自动默认Auto
    仅使用在线服务OnlineOnly
    仅使用离线引擎OfflineOnly
  • 失败后停止stopIfFailBoolean可选

    失败后是否停止动作

    填写 固定输入默认 true

输出参数

  • 是否成功isSuccessBoolean

    操作是否成功

  • 行列表textListList

    OCR识别结果,列表格式,每行一项。

    条件 仅:baidu-basic, baidu-quicker, QuickerServerOcr, LocalOcr, WindowsOcr
  • 合并后结果contentText

    合并在一起的的文本内容

    条件 仅:baidu-basic, baidu-quicker, QuickerServerOcr, LocalOcr, WindowsOcr, table_quicker
  • 原始结果rawDataText

    API接口返回的完整内容

  • 原始结果JObject对象rawObjectObject

    返回结果的JObject对象

    条件 仅:baidu-basic, baidu-quicker, baidu-custom

概述

接口/引擎 决定走哪套识别:

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
  • Quicker OCR引擎:在线服务。当前固定走在线,不再用「离线模式」切换。
  • 本地 OCR(中英):2.x 独立本地引擎,图片不上传。首次按需下载模型,可选标准和快速档。见 2.x 基础OCR说明
  • Windows10/11 内置OCR引擎
  • 百度通用文字识别(自定义帐号 / Quicker帐号)
  • 百度自定义接口识别(自定义帐号)
  • 表格识别(Quicker服务):2.x 改为本地完成。

旧动作若在 Quicker OCR 上选了「仅使用离线引擎」,会转到 本地 OCR(中英)。新动作请直接选本地 OCR。

共用参数

多数引擎都会用到:

图片变量:要识别的图。也可以传图片路径或 Base64 文本。图越小越快。

转换标点符号:不转换 / 全角 / 半角。仅 Quicker 在线、百度通用。

合并段落:按行尾是否像句子结束,决定要不要把多行合成一段。仅 Quicker 在线、百度通用。

语言:仅 Quicker 在线和表格识别。中英、英语、韩语、日语、繁体中文、拉丁语、阿拉伯语。表格识别只支持中英和英文。

失败后停止:失败是否中止动作。默认开启。

输出

  • 是否成功
  • 行列表:每行一项。Quicker 在线、本地 OCR、Windows、百度通用。
  • 合并后结果:按标点和合并段落处理后的文本。表格识别时是 HTML。
  • 原始结果:接口返回的完整内容。
  • 原始结果JObject对象:仅百度三种接口。

Quicker OCR引擎

免费在线识别。服务器资源有限,请合理使用。

  • 免费版:最短间隔 10 秒,每日最多 100 次。
  • 专业版:最短间隔 2 秒,每日最多 1000 次;可用独享 GPU。
  • 额度可能随负载调整。无首次启动延迟,适合偶尔用。

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
图片变量
img
从指定变量中加载图片
转换标点符号
合并文本时,是否转换标点符号
合并段落
是否智能合并段落。
语言
待识别内容的语言。表格识别仅支持中英混合和英文。
离线模式
旧版兼容参数。Quicker OCR 当前固定使用在线服务;旧动作选择“仅使用离线引擎”时转为本地 OCR。新动作请直接选择“本地 OCR(中英)”。
是否成功
-- 选择变量 --
操作是否成功
行列表
-- 选择变量 --
OCR识别结果,列表格式,每行一项。
合并后结果
text
合并在一起的的文本内容
原始结果
-- 选择变量 --
API接口返回的完整内容

离线模式 是旧版兼容项,仅 Quicker OCR 引擎还显示。现在这个引擎固定走在线;旧动作选「仅使用离线引擎」会改走本地 OCR。

调试运行时可以看到实际用的引擎:

本地 OCR(中英)

2.x 的本地引擎,不经过在线服务。首次使用某个模型会按需下载;标准档偏准,快速档偏小偏快。会占磁盘、内存和 CPU。复杂版面或其它语言可换别的引擎。

旧版离线包(Paddle 引擎、手动解压到 文档\Quicker\_ocr)仍可用于老环境。新动作请直接选本项,不必再装那套 zip。

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
图片变量
img
从指定变量中加载图片
是否成功
-- 选择变量 --
操作是否成功
行列表
-- 选择变量 --
OCR识别结果,列表格式,每行一项。
合并后结果
text
合并在一起的的文本内容

旧版离线识别引擎包

安装条件:64 位 Windows,CPU 支持 AVX。

适合识别很勤、需要屏幕找字、或要认整屏大图的场景。不支持多线程,不要同时在多个动作里调。首次(或超过保活时间后再用)要加载模型,会慢一点。1.2.1 起不再支持表格识别。

下载:

默认会做文字方向检测;小图可能判错。要关掉旋转检测,先装完整包,再用 quickerocragent_norotation.zip 覆盖对应文件。

安装:下载 zip → 解压 → 双击 安装到目标位置.bat,或把内容复制到 文档\Quicker\_ocr

最终目录类似:

若出现「PaddleConfig 的类型初始值设定项引发异常」,安装 Visual C++ Redistributable

离线OCR失败。“Sdcb.PaddleInference.PaddleConfig”的类型初始值设定项引发异常。
(----Quicker OCRv2:基础OCR----)

旧版保活时间在软件设置里调,避免每次重新加载模型:

Windows 10/11 内置OCR

用系统当前语言识别,速度快,效果一般。参数含义与上文共用项相同。

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
图片变量
img
从指定变量中加载图片
是否成功
-- 选择变量 --
操作是否成功
行列表
-- 选择变量 --
OCR识别结果,列表格式,每行一项。
合并后结果
text
合并在一起的的文本内容
原始结果
-- 选择变量 --
API接口返回的完整内容

百度OCR

通用文字识别(自定义帐号)

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
ApiKey
 
请填写OCR帐号的ApiKey
SecretKey
 
请填写OCR帐号的SecretKey
图片变量
img
从指定变量中加载图片
转换标点符号
合并文本时,是否转换标点符号
合并段落
是否智能合并段落。
是否成功
-- 选择变量 --
操作是否成功
行列表
-- 选择变量 --
OCR识别结果,列表格式,每行一项。
合并后结果
text
合并在一起的的文本内容
原始结果
-- 选择变量 --
API接口返回的完整内容
原始结果JObject对象
-- 选择变量 --
返回结果的JObject对象

ApiKey / SecretKey:自己的百度账号。

申请可参考:百度账号申请教程(@Marcus)。

通用文字识别(Quicker帐号)

公共账号省去自己申请,但大家共享百度每日约 5 万次免费额度:

  • 百度若取消免费额度,此方式会不可用。
  • 只适合轻度使用;量大请用自己的账号。
  • 免费版每日最多 20 次,专业版 100 次。
  • 设置里可在额度用完后花 Q豆继续,每次 0.005 Q豆。什么是 Q豆?

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
图片变量
img
从指定变量中加载图片
转换标点符号
合并文本时,是否转换标点符号
合并段落
是否智能合并段落。
是否成功
-- 选择变量 --
操作是否成功
行列表
-- 选择变量 --
OCR识别结果,列表格式,每行一项。
合并后结果
text
合并在一起的的文本内容
原始结果
-- 选择变量 --
API接口返回的完整内容
原始结果JObject对象
-- 选择变量 --
返回结果的JObject对象

全局自有 OCR 账号

在软件设置里填一组百度 ApiKey,供所有基础 OCR 步骤使用。

勾选 总是使用上面设置的自有ApiKey 后,即使步骤里选了 Quicker 账号或另填了密钥,也会改用这组全局账号。

自定义接口识别

按百度文档调用指定接口,返回原始响应。接口文档

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
ApiKey
 
请填写OCR帐号的ApiKey
SecretKey
 
请填写OCR帐号的SecretKey
图片变量
img
从指定变量中加载图片
接口名称或网址
接口的完整网址,或 https://aip.baidubce.com/rest/2.0/ocr/v1/ 后面的部分
附加参数
 
请参考百度官方/Quicker服务接口说明。每行一个参数,使用option:value的格式。
是否成功
-- 选择变量 --
操作是否成功
原始结果
-- 选择变量 --
API接口返回的完整内容
原始结果JObject对象
-- 选择变量 --
返回结果的JObject对象

接口名称或网址:完整 URL,或 https://aip.baidubce.com/rest/2.0/ocr/v1/ 后面的名字,如下拉里的 accurate_basic。个别接口域名不同,这时要填完整网址并自己试。

附加参数:词典,或每行 option:value。以百度文档为准。

表格识别(Quicker服务)

抽出图中的表格,合并后结果 是 HTML。2.x 改为本地识别。旧版在线额度:免费版约 10 分钟一次,专业版约 10 秒一次。

基础OCR

获取图片中的文字
接口/引擎
OCR接口或引擎。离线引擎安装方式请参考模块文档。
图片变量
bmp
从指定变量中加载图片
语言
待识别内容的语言。表格识别仅支持中英混合和英文。
是否成功
-- 选择变量 --
操作是否成功
合并后结果
selectedText
合并在一起的的文本内容
原始结果
-- 选择变量 --
API接口返回的完整内容

限制与排障

  • 在线 Quicker OCR 有次数和间隔限制,循环里请改用本地 OCR。
  • 旧版离线包报 PaddleConfig 异常时,先装 VC++ 运行库。
  • 百度公共账号额度用完会失败,改自己的 ApiKey 或开 Q豆续用。
  • 本地 OCR 首次会下载模型,需已登录 Quicker。

相关链接

更新历史

  • 20230505 整理文档。
  • 20241206 增加离线 OCR 测试动作。
  • 2.x 增加本地 OCR(中英);旧离线选项映射到本地引擎。

更新于