View a markdown version of this page

最佳实践 - Amazon Textract

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

最佳实践

Amazon Textract 使用机器学习来像人一样阅读文档。它从文档中提取文本、表格和表单。使用以下最佳实践从您的文档中获得最佳结果。

提供最佳输入文档

Amazon Textract 操作的合适输入是单页或多页文档。一些示例包括法律文件、表格、身份证或信件。表单是一种包含问题或提示的文档,供用户提供答案。一些例子包括患者登记表、纳税表或保险索赔表。

文档可以是 JPEG、PNG、PDF 或 TIFF 格式。使用 PDF 和 TIFF 格式的文件,您可以处理多页文档。有关 Amazon Textract 如何将文档表示为Block对象的信息,请参阅。文本检测和文档分析响应对象

以下是可接受的输入文档示例。

一张白纸 paper 的图片,标题是 “就业申请”。下一行显示申请信息,下一个全名:Jane Doe,下一个电话号码:555-0100,下一个家庭住址: AnyTown 美国 Any Street 123,下一个邮寄地址:与上面相同。下面是一张标题为 “以前的工作经历” 的表格。它有五列四行。列标题包括开始日期、结束日期、雇主姓名、担任的职位和离职原因。下一行列出了 1/15 /2009、 6/30 /2011、Any Company、助理面包师和搬迁。接下来的 /2011、 7/1 /201 8/10 3,Example Corp. Baker,更好 opp。下一个 8/15 /2013、Present、 AnyCompany、head baker 和 curr N/A ent。

有关文档限制的信息,请参阅亚马逊 Textract 中的配额

对于 Amazon Textract 同步操作,您可以使用存储在 Amazon S3 存储桶中的输入文档,也可以传递 base64 编码的图像字节。有关更多信息,请参阅 调用亚马逊 Textract 同步操作。对于异步操作,您需要在 Amazon S3 存储桶中提供输入文档。有关更多信息,请参阅 调用 Amazon Textract 异步操作

以下列出了几种优化输入文档以获得更好结果的方法。

  • 确保您的文档文本使用 Amazon Textract 支持的语言。目前,Amazon Textract 支持英语、西班牙语、德语、意大利语、法语和葡萄牙语。

  • 提供高质量的图像,理想情况下至少为 150 DPI。

  • 如果您的文档已经是亚马逊 Textract 支持的其中一种文件格式(PDF、TIFF、JPEG 和 PNG),则在将文档上传到亚马逊 Textract 之前,请勿对其进行转换或缩小采样。

为了在从文档的表格中提取文本时获得最佳结果,请确保:

  • 文档中的表格与页面上周围的元素在视觉上是分开的。例如,表格不会叠加在图像或复杂图案上。

  • 表格中的文字是直立的。例如,文本不会相对于页面上的其他文本进行旋转。

从表格中提取文本时,在以下情况下可能会看到不一致的结果:

  • 跨越多列的合并表格单元格。

  • 包含与同一表格其他部分不同的单元格、行或列的表格。

我们建议使用文本检测作为解决方法。

使用置信度分数

您应该考虑 Amazon Textract API 操作返回的置信度分数及其用例的敏感性。置信度分数是一个介于 0 和 100 之间的数字,表示给定预测正确的概率。它可以帮助您就如何使用结果做出明智的决定。

在对检测错误(误报)敏感的应用程序中,强制使用最低置信度分数阈值。申请应丢弃低于该阈值的结果,或者将情况标记为需要更高级别的人工审查。

最佳阈值取决于应用程序。出于存档目的,例如记录手写笔记,可能低至50%。涉及财务决策的业务流程可能需要90%或更高的阈值。