TPUでのOLMo 3 7B再現が、隠れたデータローダーのバグを明らかに
Googleのケーススタディでは、AI2のOLMo 3モデルをTPU上で再現し、性能指標を一致させると同時に、改善と誤認されていた重要なデータシャーディングエラーを発見しました。
RAG、評価、推論、ファインチューニング、LLM機能の本番運用。
Googleのケーススタディでは、AI2のOLMo 3モデルをTPU上で再現し、性能指標を一致させると同時に、改善と誤認されていた重要なデータシャーディングエラーを発見しました。
Google Developers Blogは、Cloud TPU上のSFTおよびRLポストトレーニングにおけるハイパーパラメータ調整を自動化するエージェント駆動システム「autofinetune」の詳細を紹介しています。
Googleは、vLLMにおけるネイティブTPUサポートがQwen3モデル向けに弾力的なスケーリングと高精度な埋め込み推論をどのように可能にするかについて詳述しています。
Kubernetesは部分的なデバイス障害に対するネイティブサポートを欠いており、エンジニアは高価なAIおよびMLトレーニングジョブのために独自の修復ロジックを構築せざるを得ない状況にあります。
Kubernetesプロジェクトは、生成AIワークロードのルーティングを標準化し、レイテンシの削減とGPU利用率の向上を実現する「Gateway API Inference Extension」をリリースしました。