Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Bonnes pratiques
Amazon Textract utilise le machine learning pour lire les documents comme le ferait une personne. Il extrait le texte, les tableaux et les formulaires des documents. Utilisez les meilleures pratiques suivantes pour tirer le meilleur parti de vos documents.
Fournir un document d'entrée optimal
Une entrée appropriée pour une opération Amazon Textract est un document d'une ou de plusieurs pages. Il s'agit par exemple d'un document juridique, d'un formulaire, d'une pièce d'identité ou d'une lettre. Un formulaire est un document contenant des questions ou invitant un utilisateur à fournir des réponses. Il s'agit par exemple d'un formulaire d'enregistrement d'un patient, d'un formulaire fiscal ou d'un formulaire de réclamation d'assurance.
Un document peut être au format JPEG, PNG, PDF ou TIFF. Avec les fichiers au format PDF et TIFF, vous pouvez traiter des documents de plusieurs pages. Pour plus d'informations sur la façon dont Amazon Textract représente les documents sous forme d'Blockobjets, consultez. Objets de réponse pour la détection de texte et l'analyse de documents
Voici un exemple de document d'entrée acceptable.
Pour plus d'informations sur les limites de documents, voirQuotas dans Amazon Textract.
Pour les opérations synchrones Amazon Textract, vous pouvez utiliser des documents d'entrée stockés dans un compartiment Amazon S3, ou vous pouvez transmettre des octets d'image codés en base64. Pour de plus amples informations, veuillez consulter Appeler Amazon Textract Synchronous Operations. Pour les opérations asynchrones, vous devez fournir les documents d'entrée dans un compartiment Amazon S3. Pour de plus amples informations, veuillez consulter Appeler les opérations asynchrones d'Amazon Textract.
Vous trouverez ci-dessous une liste de quelques moyens d'optimiser vos documents d'entrée pour de meilleurs résultats.
Assurez-vous que le texte de votre document est rédigé dans une langue prise en charge par Amazon Textract. Actuellement, Amazon Textract prend en charge l'anglais, l'espagnol, l'allemand, l'italien, le français et le portugais.
Fournissez une image de haute qualité, idéalement d'au moins 150 DPI.
Si votre document est déjà dans l'un des formats de fichier pris en charge par Amazon Textract (PDF, TIFF, JPEG et PNG), ne le convertissez pas ou ne sous-échantillonnez pas le document avant de le télécharger sur Amazon Textract.
Pour obtenir les meilleurs résultats lors de l'extraction de texte à partir de tableaux dans des documents, assurez-vous que :
Les tableaux de votre document sont séparés visuellement des éléments qui les entourent sur la page. Par exemple, le tableau n'est pas superposé à une image ou à un motif complexe.
Le texte du tableau est à la verticale. Par exemple, le texte n'est pas pivoté par rapport aux autres textes de la page.
Lorsque vous extrayez du texte à partir de tableaux, vous pouvez obtenir des résultats incohérents dans les cas suivants :
Cellules de tableau fusionnées qui s'étendent sur plusieurs colonnes.
Tableaux contenant des cellules, des lignes ou des colonnes différentes des autres parties du même tableau.
Nous vous recommandons d'utiliser la détection de texte comme solution de contournement.
Utiliser les scores de confiance
Vous devez tenir compte des scores de confiance renvoyés par les opérations de l'API Amazon Textract et de la sensibilité de leur cas d'utilisation. Un score de confiance est un nombre compris entre 0 et 100 qui indique la probabilité qu'une prédiction donnée soit correcte. Il vous aide à prendre des décisions éclairées sur la façon dont vous utilisez les résultats.
Dans les applications sensibles aux erreurs de détection (faux positifs), appliquez un seuil de score de confiance minimal. L'application doit rejeter les résultats inférieurs à ce seuil ou signaler les situations nécessitant un plus haut niveau de surveillance humaine.
Le seuil optimal dépend de l'application. À des fins d'archivage, par exemple pour documenter des notes manuscrites, il peut être inférieur à 50 %. Les processus métier impliquant des décisions financières peuvent nécessiter des seuils de 90 % ou plus.