本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
最佳實務
Amazon Textract 使用機器學習像一個人一樣讀取文件。它會從文件中擷取文字、資料表和表單。使用下列最佳實務,從您的文件取得最佳結果。
提供最佳輸入文件
Amazon Textract 操作的適當輸入是單一或多頁文件。有些範例是法律文件、表單、ID 或字母。表單是一種文件,其中包含使用者提供答案的問題或提示。一些範例包括患者註冊表單、稅務表單或保險索賠表單。
文件可以是 JPEG、PNG、PDF 或 TIFF 格式。透過 PDF 和 TIFF 格式檔案,您可以處理多頁文件。如需 Amazon Textract 如何將文件表示為Block物件的資訊,請參閱 文字偵測和文件分析回應物件。
以下是可接受的輸入文件範例。
如需文件限制的資訊,請參閱 Amazon Textract 中的配額。
對於 Amazon Textract 同步操作,您可以使用存放在 Amazon S3 儲存貯體中的輸入文件,也可以傳遞 base64 編碼的影像位元組。如需詳細資訊,請參閱呼叫 Amazon Textract 同步操作。對於非同步操作,您需要在 Amazon S3 儲存貯體中提供輸入文件。如需詳細資訊,請參閱呼叫 Amazon Textract 非同步操作。
以下是您可以最佳化輸入文件以獲得更佳結果的幾種方法清單。
確保您的文件文字使用 Amazon Textract 支援的語言。目前,Amazon Textract 支援英文、西班牙文、德文、義大利文、法文和葡萄牙文。
提供高品質的映像,理想情況下至少 150 個 DPI。
如果您的文件已採用 Amazon Textract 支援的其中一種檔案格式 (PDF、TIFF、JPEG 和 PNG),請勿在將文件上傳至 Amazon Textract 之前轉換或減少取樣文件。
若要在從文件中的資料表擷取文字時獲得最佳結果,請確保:
文件中的資料表會與頁面上的周圍元素以視覺化方式分隔。例如,資料表不會覆蓋在影像或複雜模式上。
資料表中的文字是直立的。例如,文字不會相對於頁面上的其他文字旋轉。
從資料表擷取文字時,您可能會在下列情況下看到不一致的結果:
跨多個資料欄的合併資料表儲存格。
儲存格、資料列或資料欄與相同資料表的其他部分不同的資料表。
我們建議您使用文字偵測做為解決方法。
使用可信度分數
您應該考慮 Amazon Textract API 操作傳回的可信度分數及其使用案例的敏感度。可信度分數是介於 0 到 100 之間的數字,表示指定預測正確的機率。它可協助您針對如何使用結果做出明智的決策。
在對偵測錯誤 (誤判) 敏感的應用程式中,強制執行最低可信度分數閾值。應用程式應捨棄低於該閾值的結果,或將情況標記為需要更高層級的人工審查。
最佳閾值取決於應用程式。對於存檔目的,例如記錄手寫筆記,可能低至 50%。涉及財務決策的業務流程可能需要 90% 或更高的閾值。