Transformers v5.14.0リリース、975BのMoEモデル「Inkling」追加とSDPA高速化
Hugging FaceのTransformersライブラリがv5.14.0を公開しました。Thinking Machines発の大規模MoEモデル「Inkling」やTIPSv2/DPTモデルが追加されたほか、GPTNeoXとGPTBigCodeの挙動を変更する破壊的変更、生成・キャッシュまわりの性能改善が盛り込まれています。
トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。
Hugging FaceのTransformersライブラリがv5.14.0を公開しました。Thinking Machines発の大規模MoEモデル「Inkling」やTIPSv2/DPTモデルが追加されたほか、GPTNeoXとGPTBigCodeの挙動を変更する破壊的変更、生成・キャッシュまわりの性能改善が盛り込まれています。
vLLMのv0.26.0がリリースされ、212人のコントリビューターによる411件のコミットが取り込まれました。新モデルファミリー「Inkling」の追加、DeepSeek-V4向けの推論カーネル最適化、KVキャッシュオフロード機能の成熟化に加え、pickleデシリアライズの脆弱性排除などセキュリティ修正も行われています。
vLLM v0.23.0が公開され、DeepSeek-V4の推論基盤が大幅に強化されるとともに、次世代実行エンジン「Model Runner V2」がLlama・Mistral系のdenseモデルにも標準適用されました。あわせてマルチティアKVキャッシュオフロードや推論・ツール呼び出しパーサーの統一化など、実運用を見据えた改善が多数含まれています。なお本バージョンではMinimax M3はまだサポート対象外です。
vLLMのv0.25.0がリリースされ、Model Runner V2(MRv2)がすべての密モデルの標準実行パスとなり、旧来のPagedAttention実装が削除されました。あわせて統一ツールコール/推論パース基盤「Streaming Parser Engine」の追加、異種語彙対応の投機的デコード、複数の新モデル対応など、232名のコントリビューターによる558件のコミットが取り込まれています。
Hugging Face公式ブログにて、Hugging Face Jobs上でvLLMサーバーを1コマンドで起動できるようになったことが発表されました。今回公開された記事は「Run a vLLM Server on HF Jobs in One Command」というタイトルのみで、具体的な手順や対応環境などの詳細本文は現時点で確認できません。
Hugging Faceは、vLLM上でtransformersのモデル実装を利用する「transformersモデリングバックエンド」を改良し、vLLM専用に書かれたネイティブ実装と同等かそれ以上の推論速度を実現したと発表しました。torch.fxによる静的解析とASTによるコード書き換えで、推論に最適化されたレイヤー融合を実行時に自動適用する仕組みです。Qwen3の複数モデルでの検証結果や、開発者への実務的な影響を紹介します。
vLLMプロジェクトはv0.24.0をリリースしました。256人のコントリビューターによる571件のコミットが取り込まれ、MiniMax-M3への新規対応やDeepSeek-V4の性能最適化、Model Runner V2の機能拡張、そしてCUDA_VISIBLE_DEVICESの内部設定廃止などが盛り込まれています。あわせて複数のセキュリティ修正も実施されました。