View a markdown version of this page

Étape 4 : vérification et résolution des problèmes - AWS Batch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Étape 4 : vérification et résolution des problèmes

Après avoir soumis une tâche qui déclenche le dimensionnement de l'instance, vérifiez que les fichiers journaux apparaissent dans le compartiment Amazon S3.

Astuce

Pour tester la collecte des journaux avant un déploiement complet, définissez minvCpus une valeur différente de zéro dans votre environnement informatique. Cela oblige AWS Batch à augmenter la taille d'au moins une instance sans attendre la soumission d'une tâche. minvCpusRemettez à zéro après les tests pour éviter des coûts inutiles.

AWS Console
  1. Ouvrez la console Amazon S3 à l'adresse https://console.aws.amazon.com/s3/.

  2. Ouvrez votre compartiment et naviguez jusqu'au ecs-logs/ préfixe.

  3. Vérifiez que les dossiers nommés avec des ID d'instance apparaissent. Chaque dossier contient des sous-répertoires pour chaque source de journal.

AWS CLI

Exécutez la commande suivante pour répertorier les objets de journal téléchargés :

aws s3 ls s3://host-level-logs-bucket/ecs-logs/ --recursive

Si la commande renvoie des objets organisés par ID d'instance, date et balise source, la collecte des journaux fonctionne correctement.

Si aucun journal n'apparaît, connectez-vous à l'instance à l'aide de SSH ou du gestionnaire de session SSM pour déboguer l'agent. Fluent Bit Vérifiez l'état du service avecsystemctl status fluent-bit. Vérifiez /var/log/cloud-init-output.log pour confirmer que le user-data script a bien été exécuté.

Considérations relatives aux instances Spot et aux instances de courte durée

Lorsque vous utilisez des instances Spot ou des environnements informatiques de courte durée qui évoluent fréquemment jusqu'à zéro, pensez aux ajustements suivants pour éviter la perte de données de journal :

  • Détectez le risque de récupération : abaissez les total_file_size valeurs upload_timeout et fluent-bit.conf pour vider les données du journal plus fréquemment. Cela réduit la fenêtre de données susceptible d'être perdue si une instance est récupérée.

  • Short-lived instances — Lorsque la mise à l' AWS Batch échelle est nulle entre les tâches, Flush réduisez l'intervalle upload_timeout afin que les données collectées soient téléchargées avant la fin de l'instance.

  • Règles relatives au cycle de vie d'Amazon S3 : nous vous recommandons de configurer une règle de cycle de vie Amazon S3 pour faire expirer ou transférer les anciens objets de journal vers une classe de stockage moins coûteuse. Cela empêche une croissance illimitée du stockage.