GoogleはGKE(Google Kubernetes Engine)に「Pod snapshots」機能を導入し、AIワークロードの起動時間を最大89%削減することを発表した。この機能はCPU・GPUメモリを含む実行状態を保存・復元でき、700億パラメータのLLMを37秒、80億パラメータモデルを15秒で起動可能にする。コールドスタート問題を解消することで過剰なインフラプロビジョニングが不要になり、LLM推論サーバーやエージェントAI向けサンドボックス環境を運用する企業のコスト削減とスケーラビリティ向上に大きく貢献する。
読み込み中...
コメントを投稿するにはログインしてください