低VRAM環境でのLoRA学習において、bitsandbytesに代わりGGUFが採用
新たな技術により、限られたVRAMで巨大なQwenやDeepSeekモデルをGGUFベース形式を用いて学習可能となり、特定のハードウェアではCPUオフロードの必要性が解消されました。
AI、開発者向けツール、インフラのデイリーカバー。各記事では、何が起こり、なぜ重要なのかを解説し、元の出典へのリンクを提供します。
新たな技術により、限られたVRAMで巨大なQwenやDeepSeekモデルをGGUFベース形式を用いて学習可能となり、特定のハードウェアではCPUオフロードの必要性が解消されました。
MicrosoftはFoundryで「Microsoft-Decision-1」をリリースしました。AlibabaのQwen3.5-9Bを基盤としており、競合と同じ価格設定ですが、画像サポートとオープンウェイトは省略されています。
openTPUプロジェクトは、単一のリポジトリで完全なAIアクセラレータ設計を公開しました。Kintex-7 FPGAカード上でQwen3やLFM2.5などのモデルを実行し、ビット単位でのシミュレーション精度を実現しています。
Amazonは、マルチターン強化学習を用いてQwen3.6-27B検索エージェントをファインチューニングし、失敗率を22%から1%未満に削減すると同時に、検索品質を向上させる方法を実証しました。
Bespoke Labsは、Qwen3.5-9Bからファインチューニングされたオープンウェイトの9B意思決定モデル「Nimble」をリリースしました。このモデルは、ローカルハードウェア上で100ミリ秒未満で構造化された質問に対する確率的な回答を提供します。
Googleは、vLLMにおけるネイティブTPUサポートがQwen3モデル向けに弾力的なスケーリングと高精度な埋め込み推論をどのように可能にするかについて詳述しています。