AWSはAmazon EKS上でNVIDIA Resiliency Extension(NVRx)をPyTorch FSDPトレーニングに統合する手法を公開した。非同期チェックポイント、プロセス内再起動、ft_launcherによるジョブ内再起動を活用することで、GPU障害からの復旧を数秒で実現する。H100を使った2〜8ノードのベンチマークでは99%以上のトレーニング効率を達成しており、大規模分散学習の安定性と効率を求めるMLエンジニアや研究者に直接影響する。
読み込み中...
コメントを投稿するにはログインしてください