View a markdown version of this page

步驟 4:驗證和疑難排解 - AWS Batch

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

步驟 4:驗證和疑難排解

在您提交觸發執行個體擴展的任務之後,請確認日誌檔案出現在 Amazon S3 儲存貯體中。

提示

若要在完全推出之前測試日誌集合,請在運算環境中將 minvCpus 設定為非零值。這 AWS Batch 可強制擴展至少一個執行個體,而無需等待任務提交。測試後將 設minvCpus回零,以避免不必要的成本。

AWS Console
  1. 開啟位於 https://console.aws.amazon.com/s3/ 的 Amazon S3 主控台。

  2. 開啟您的儲存貯體並導覽至 ecs-logs/字首。

  3. 確認名為 的資料夾顯示執行個體 IDs。每個資料夾都包含每個日誌來源的子目錄。

AWS CLI

執行下列命令來列出上傳的日誌物件:

aws s3 ls s3://host-level-logs-bucket/ecs-logs/ --recursive

如果命令傳回依執行個體 ID、日期和來源標籤整理的物件,則日誌集合會正常運作。

如果日誌未出現,請使用 SSH 或 SSM Session Manager 來偵錯Fluent Bit代理程式,以連線至執行個體。使用 檢查服務狀態systemctl status fluent-bit。檢閱/var/log/cloud-init-output.log以確認user-data指令碼已成功執行。

Spot 和短期執行個體的考量事項

當您使用 Spot 執行個體或經常擴展至零的短期運算環境時,請考慮下列調整以避免日誌資料遺失:

  • Spot 回收風險 – 降低 中的 upload_timeouttotal_file_sizefluent-bit.conf,以更頻繁地排清日誌資料。這可減少回收執行個體時可能遺失的資料時段。

  • 短期執行個體 – 當任務之間 AWS Batch 擴展至零時,請降低Flush間隔,upload_timeout以便在執行個體終止之前上傳收集的資料。

  • Amazon S3 生命週期規則 – 建議您設定 Amazon S3 生命週期規則,以將舊日誌物件過期或轉換為成本較低的儲存類別。這可防止無限制的儲存體成長。