
前言传统人工录入图文资料存在效率低、出错率高、无法留存文字位置版式信息等问题。本通用文字识别 API 依托深度学习优化算法识别精度最高可达 99.9%支持图片、PDF、OFD 文件解析同步返回文本坐标、轮廓点位、段落结构与置信度数据可快速对接各类业务系统完成图像文字结构化、版式还原等智能化处理。通用文字识别在以下场景中应用广泛政务档案数字化财务单据自动处理资质证件信息采集固化电子文档解析日常图文文字提取工业资产信息采集版面还原与标注开发企业办公自动化API介绍请求说明名称类型必须说明imageString否图片base64pdfString否PDF文件的base64pdfNumString否需要识别的PDF文件的对应页码不传默认识别第 1 页ofdString否OFD文件的base64ofdNumString否需要识别的OFD文件的对应页码不传默认识别第 1 页fileFile否文件urlString否文件地址image、pdf、ofd、file、url 必须提供一个优先级image pdf ofd file url文件不超过4M最短边至少15px最长边最大4096px图片格式为 jpg、png、bmp、jpeg戳这里查看详情返回样例{msg:成功,// code 对应的描述code:200,// 详见code返回码说明taskNo:316942821199035820008485,// 本次请求号charge:true,// 计费标志data:{resultNum:2,//识别结果数result:[//识别结果{words:测试第一行,//识别结果字符串location:{//位置数组坐标0点为左上角top:72,//表示定位位置的长方形左上顶点的垂直坐标left:89,//表示定位位置的长方形左上顶点的水平坐标width:52,//表示定位位置的长方形的宽度height:12//表示定位位置的长方形的高度},probability:{//表示识别结果中每一行的置信度值average:0.9956096411,//行置信度平均值min:0.9842295051,//行置信度最小值variance:0.00003516419747//行置信度方差},vertexesLocation:[//识别结果中每一行的外包四边形点坐标{x:90,//水平坐标坐标0点为左上角y:73//垂直坐标坐标0点为左上角},{x:142,y:73},{x:142,y:85},{x:90,y:85}],finegrainedVertexesLocation:[//识别结果中每一行的多边形轮廓点坐标{x:89,y:72},{x:101,y:72},{x:113,y:72},{x:124,y:72},{x:136,y:72},{x:141,y:72},{x:141,y:78},{x:141,y:84},{x:130,y:84},{x:118,y:84},{x:106,y:84},{x:95,y:84},{x:89,y:84},{x:89,y:78}]},],paragraphsResult:[//段落检测结果{wordsResultIdx:[//一个段落包含的行序号0,1],finegrainedVertexesLocation:[//识别结果中每一行的多边形轮廓点坐标{x:89,y:72},{x:101,y:72},{x:113,y:72},{x:124,y:72},{x:136,y:72},{x:141,y:72},{x:141,y:72},{x:141,y:84},{x:141,y:88},{x:141,y:100},{x:141,y:100},{x:129,y:100},{x:117,y:100},{x:104,y:99},{x:92,y:99},{x:89,y:99},{x:89,y:99},{x:89,y:87},{x:89,y:84},{x:89,y:72}]}],paragraphsResultNum:1,//识别结果数表示 paragraphsResult 的元素个数pdfFileSize:1//传入PDF文件的总页数当 pdfFile 参数有效时返回该字段}}