View a markdown version of this page

最佳實務 - Amazon Textract

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

最佳實務

Amazon Textract 使用機器學習像一個人一樣讀取文件。它會從文件中擷取文字、資料表和表單。使用下列最佳實務,從您的文件取得最佳結果。

提供最佳輸入文件

Amazon Textract 操作的適當輸入是單一或多頁文件。有些範例是法律文件、表單、ID 或字母。表單是一種文件,其中包含使用者提供答案的問題或提示。一些範例包括患者註冊表單、稅務表單或保險索賠表單。

文件可以是 JPEG、PNG、PDF 或 TIFF 格式。透過 PDF 和 TIFF 格式檔案,您可以處理多頁文件。如需 Amazon Textract 如何將文件表示為Block物件的資訊,請參閱 文字偵測和文件分析回應物件

以下是可接受的輸入文件範例。

具有標頭僱用應用程式之白紙的影像。下一行顯示應用程式資訊,下一個全名:Jane Doe,下一個電話號碼:555-0100,下一個住家地址:123 Any Street, AnyTown USA,下一個郵寄地址:如上所述。下方是標題為先前工作歷史記錄的資料表。它有五個資料欄和四個資料列。資料欄標題為開始日期、結束日期、雇主名稱、保留位置和離職原因。下一列列出 1/15/2009、6/30/2011、任何公司、助理烘焙師和重新定位。下一個 7/1/2011、8/10/2013、Example Corp. Baker,更好的操作。下一個 8/15/2013、Present、AnyCompany、Head Bakker 和 N/A、目前。

如需文件限制的資訊,請參閱 Amazon Textract 中的配額

對於 Amazon Textract 同步操作,您可以使用存放在 Amazon S3 儲存貯體中的輸入文件,也可以傳遞 base64 編碼的影像位元組。如需詳細資訊,請參閱呼叫 Amazon Textract 同步操作。對於非同步操作,您需要在 Amazon S3 儲存貯體中提供輸入文件。如需詳細資訊,請參閱呼叫 Amazon Textract 非同步操作

以下是您可以最佳化輸入文件以獲得更佳結果的幾種方法清單。

  • 確保您的文件文字使用 Amazon Textract 支援的語言。目前,Amazon Textract 支援英文、西班牙文、德文、義大利文、法文和葡萄牙文。

  • 提供高品質的映像,理想情況下至少 150 個 DPI。

  • 如果您的文件已採用 Amazon Textract 支援的其中一種檔案格式 (PDF、TIFF、JPEG 和 PNG),請勿在將文件上傳至 Amazon Textract 之前轉換或減少取樣文件。

若要在從文件中的資料表擷取文字時獲得最佳結果,請確保:

  • 文件中的資料表會與頁面上的周圍元素以視覺化方式分隔。例如,資料表不會覆蓋在影像或複雜模式上。

  • 資料表中的文字是直立的。例如,文字不會相對於頁面上的其他文字旋轉。

從資料表擷取文字時,您可能會在下列情況下看到不一致的結果:

  • 跨多個資料欄的合併資料表儲存格。

  • 儲存格、資料列或資料欄與相同資料表的其他部分不同的資料表。

我們建議您使用文字偵測做為解決方法。

使用可信度分數

您應該考慮 Amazon Textract API 操作傳回的可信度分數及其使用案例的敏感度。可信度分數是介於 0 到 100 之間的數字,表示指定預測正確的機率。它可協助您針對如何使用結果做出明智的決策。

在對偵測錯誤 (誤判) 敏感的應用程式中,強制執行最低可信度分數閾值。應用程式應捨棄低於該閾值的結果,或將情況標記為需要更高層級的人工審查。

最佳閾值取決於應用程式。對於存檔目的,例如記錄手寫筆記,可能低至 50%。涉及財務決策的業務流程可能需要 90% 或更高的閾值。