本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
最佳实践
Amazon Textract 使用机器学习来像人一样阅读文档。它从文档中提取文本、表格和表单。使用以下最佳实践从您的文档中获得最佳结果。
提供最佳输入文档
Amazon Textract 操作的合适输入是单页或多页文档。一些示例包括法律文件、表格、身份证或信件。表单是一种包含问题或提示的文档,供用户提供答案。一些例子包括患者登记表、纳税表或保险索赔表。
文档可以是 JPEG、PNG、PDF 或 TIFF 格式。使用 PDF 和 TIFF 格式的文件,您可以处理多页文档。有关 Amazon Textract 如何将文档表示为Block对象的信息,请参阅。文本检测和文档分析响应对象
以下是可接受的输入文档示例。
有关文档限制的信息,请参阅亚马逊 Textract 中的配额。
对于 Amazon Textract 同步操作,您可以使用存储在 Amazon S3 存储桶中的输入文档,也可以传递 base64 编码的图像字节。有关更多信息,请参阅 调用亚马逊 Textract 同步操作。对于异步操作,您需要在 Amazon S3 存储桶中提供输入文档。有关更多信息,请参阅 调用 Amazon Textract 异步操作。
以下列出了几种优化输入文档以获得更好结果的方法。
确保您的文档文本使用 Amazon Textract 支持的语言。目前,Amazon Textract 支持英语、西班牙语、德语、意大利语、法语和葡萄牙语。
提供高质量的图像,理想情况下至少为 150 DPI。
如果您的文档已经是亚马逊 Textract 支持的其中一种文件格式(PDF、TIFF、JPEG 和 PNG),则在将文档上传到亚马逊 Textract 之前,请勿对其进行转换或缩小采样。
为了在从文档的表格中提取文本时获得最佳结果,请确保:
文档中的表格与页面上周围的元素在视觉上是分开的。例如,表格不会叠加在图像或复杂图案上。
表格中的文字是直立的。例如,文本不会相对于页面上的其他文本进行旋转。
从表格中提取文本时,在以下情况下可能会看到不一致的结果:
跨越多列的合并表格单元格。
包含与同一表格其他部分不同的单元格、行或列的表格。
我们建议使用文本检测作为解决方法。
使用置信度分数
您应该考虑 Amazon Textract API 操作返回的置信度分数及其用例的敏感性。置信度分数是一个介于 0 和 100 之间的数字,表示给定预测正确的概率。它可以帮助您就如何使用结果做出明智的决定。
在对检测错误(误报)敏感的应用程序中,强制使用最低置信度分数阈值。申请应丢弃低于该阈值的结果,或者将情况标记为需要更高级别的人工审查。
最佳阈值取决于应用程序。出于存档目的,例如记录手写笔记,可能低至50%。涉及财务决策的业务流程可能需要90%或更高的阈值。