As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Analisando documentos
O Amazon Textract analisa documentos e formulários em busca de relações entre o texto detectado. As operações de análise do Amazon Textract retornam 5 categorias de extração de documentos — texto, formulários, tabelas, respostas de consultas e assinaturas. A análise de faturas e recibos é feita por meio de um processo diferente, para obter mais informações, consulte. Analisando faturas e recibos
Extração de texto
O texto bruto extraído de um documento. Para obter mais informações, consulte Linhas e palavras de texto.
Extração de formulários
Os dados do formulário são vinculados aos itens de texto extraídos de um documento. O Amazon Textract representa os dados do formulário como pares de valores-chave.
No exemplo a seguir, uma das linhas de texto detectadas pelo Amazon Textract é Name: Jane Doe. O Amazon Textract também identifica uma chave (Nome:) e um valor (Jane Doe). Para obter mais informações, consulte Dados do formulário (Key-valuepares).
Nome: Jane Doe
Endereço: 123 Any Street, Anytown, EUA
Data de nascimento: 12-26-1980
Key-value pares também são usados para representar caixas de seleção ou botões de opção (botões de rádio) que são extraídos dos formulários.
Masculino: ☑
Para obter mais informações, consulte Elementos de seleção.
Extração de tabela
O Amazon Textract pode extrair tabelas, células da tabela, os itens dentro das células da tabela, títulos e rodapés da tabela e o tipo de tabela. O Amazon Textract também pode ser programado para retornar os resultados em um arquivo JSON, CSV ou TXT.
| Nome | Endereço |
|---|---|
|
Ana Carolina |
123 Qualquer cidade |
Para obter mais informações, consulte Tabelas. Os elementos de seleção também podem ser extraídos das tabelas. Para obter mais informações, consulte Elementos de seleção.
Assinaturas na análise de documentos
O Amazon Textract pode detectar a localização das assinaturas em documentos de texto. Eles são retornados como objetos de geometria com caixas delimitadoras que fornecem a localização de uma assinatura na página, juntamente com a confiança de que a assinatura está nesse local. Se o recurso de assinatura for usado sozinho, o Amazon Textract retornará tanto as assinaturas quanto os resultados padrão de detecção de texto. A detecção de assinatura pode ser usada em conjunto com outros tipos de recursos, como formulários, tabelas e consultas. Ao usá-lo com formulários e tabelas, as assinaturas podem ser detectadas como parte de um par de valores-chave ou dentro de uma célula da tabela, respectivamente.
Consultas na análise de documentos
Ao processar um documento com o Amazon Textract, você pode adicionar consultas à sua análise para especificar quais informações você precisa. Isso envolve fazer uma pergunta, como “Qual é o número do seguro social do cliente?” para o Amazon Textract. Em seguida, o Amazon Textract encontrará as informações no documento para essa pergunta e as retornará em uma estrutura de resposta separada do restante das informações do documento. Para obter mais informações sobre essa estrutura de resposta, consulte Estruturas de resposta de consulta. Para obter mais informações sobre as melhores práticas para o uso de consultas, consultePráticas recomendadas para consultas. As consultas podem ser processadas sozinhas ou em combinação com outrasFeatureType, como tabelas ou formulários.
Exemplo de consulta: Qual é o SSN do cliente?
Exemplo de resposta: 111-xx-333
Para itens analisados, o Amazon Textract retorna o seguinte em vários objetos Block:
-
As linhas e palavras do texto detectado
-
O conteúdo dos itens detectados
-
A relação entre os itens detectados
-
A página em que o item foi detectado
-
A localização do item na página do documento
Consultas personalizadas
Com a análise de documentos do Amazon Textract, você pode personalizar a saída do modelo por meio de adaptadores treinados em seus próprios documentos. Os adaptadores são componentes que se conectam ao modelo de aprendizado profundo pré-treinado do Amazon Textract, personalizando sua saída para documentos específicos da sua empresa. Você cria um adaptador para seu caso de uso específico por meio de annotating/labeling seus documentos de amostra e treina o adaptador nas amostras anotadas.
Depois de criar um adaptador, o Amazon Textract fornece um. AdapterId Você pode ter várias versões de adaptador em um único adaptador. Você pode fornecer o AdapterId, junto com um AdapterVersion, a uma operação para especificar que deseja usar o adaptador que você criou. Por exemplo, você fornece os dois parâmetros à AnalyzeDocumentAPI para análise síncrona de documentos ou a StartDocumentAnalysisoperação para análise assíncrona. Fornecer o AdapterId como parte da solicitação integrará automaticamente o adaptador ao processo de análise e o usará para aprimorar as previsões de seus documentos. Dessa forma, você pode aproveitar os recursos do AnalyzeDocument enquanto personaliza o modelo para se adequar ao seu próprio caso de uso.
Para obter mais informações sobre como criar e usar adaptadores, consulte Personalizando suas respostas de consultas. Para obter um tutorial sobre como criar, treinar e usar adaptadores com o Console de gerenciamento da AWS, consulteTutorial de consultas personalizadas.
Layout na análise de documentos
O Amazon Textract pode ser usado para detectar o layout de um documento encontrando a localização de diferentes elementos e suas linhas de texto associadas. Esses elementos são parágrafos, listas, cabeçalhos, rodapés, números de página, figuras, tabelas, títulos e cabeçalhos de seção. Ao analisar o layout de um documento, o Amazon Textract retorna a localização da caixa delimitadora dos elementos do layout, bem como do texto nesses elementos. Essas informações são retornadas na ordem de leitura implícita do documento, listando os elementos de cima para baixo, da esquerda para a direita.
Você pode usar operações síncronas ou assíncronas para analisar texto em um documento. Para analisar o texto de forma síncrona, use a AnalyzeDocumentoperação e passe um documento como entrada. AnalyzeDocumentretorna todo o conjunto de resultados. Para obter mais informações, consulte Análise do texto do documento com o Amazon Textract.
Para detectar texto de forma assíncrona, use StartDocumentAnalysispara iniciar o processamento. Para obter os resultados, ligue GetDocumentAnalysis. Os resultados são retornados em uma ou mais respostas deGetDocumentAnalysis. Para obter mais informações e um exemplo, consulte Detectando ou analisando texto em um documento de várias páginas.
Para especificar o tipo de análise a ser executada, você pode usar o parâmetro FeatureTypes de entrada da lista. Adicione TABLES à lista para retornar informações sobre as tabelas detectadas no documento de entrada — por exemplo, células da tabela, texto da célula e elementos de seleção nas células. Adicione FORMULÁRIOS para retornar relacionamentos de palavras, como pares de valores-chave e elementos de seleção. Adicione CONSULTAS para especificar as informações que você deseja que o Amazon Textract procure no documento e receba uma resposta na forma de um par de perguntas e respostas. Adicione LAYOUT para determinar o layout do documento. Para realizar todos os tipos de análise, adicione TABELAS, FORMULÁRIOS, CONSULTAS e LAYOUT a. FeatureTypes
Todas as linhas e palavras detectadas no documento são incluídas na resposta (incluindo texto não relacionado ao valor deFeatureTypes).