Primary Sources Only

公式ブログとリリースノートを、日本語の記事にして毎朝届けます。

まとめサイトの記事や機械翻訳ではなく、一次情報だけを追っています。興味のあるトピックだけ選んで読めます。

トピック: vllm解除

Transformers v5.14.0リリース、975BのMoEモデル「Inkling」追加とSDPA高速化

Transformers (Hugging Face)重要度 75掲載 2026/8/22 15:52

ワンポイントSDPAプレフィルがStaticCacheで最大260%高速化

Hugging FaceのTransformersライブラリがv5.14.0を公開しました。Thinking Machines発の大規模MoEモデル「Inkling」やTIPSv2/DPTモデルが追加されたほか、GPTNeoXとGPTBigCodeの挙動を変更する破壊的変更、生成・キャッシュまわりの性能改善が盛り込まれています。

vLLM v0.26.0リリース、DeepSeek-V4の推論性能を大幅強化しセキュリティ修正も多数実施

vLLM重要度 75掲載 2026/8/4 06:22

ワンポイントDeepSeek-V4のTPOTが最大2.94%改善、pickle脆弱性も排除

vLLMのv0.26.0がリリースされ、212人のコントリビューターによる411件のコミットが取り込まれました。新モデルファミリー「Inkling」の追加、DeepSeek-V4向けの推論カーネル最適化、KVキャッシュオフロード機能の成熟化に加え、pickleデシリアライズの脆弱性排除などセキュリティ修正も行われています。

vLLM v0.23.0リリース、DeepSeek-V4の最適化とModel Runner V2の対応拡大が進む

vLLM重要度 75掲載 2026/7/14 09:51

ワンポイントModel Runner V2がLlama・Mistralのdenseモデルにも標準適用

vLLM v0.23.0が公開され、DeepSeek-V4の推論基盤が大幅に強化されるとともに、次世代実行エンジン「Model Runner V2」がLlama・Mistral系のdenseモデルにも標準適用されました。あわせてマルチティアKVキャッシュオフロードや推論・ツール呼び出しパーサーの統一化など、実運用を見据えた改善が多数含まれています。なお本バージョンではMinimax M3はまだサポート対象外です。

vLLM v0.25.0リリース、Model Runner V2が標準実行パスに昇格しPagedAttentionを削除

vLLM重要度 80掲載 2026/7/12 16:51

ワンポイントPagedAttention削除、MRv2が全密モデルの標準実行パスに

vLLMのv0.25.0がリリースされ、Model Runner V2(MRv2)がすべての密モデルの標準実行パスとなり、旧来のPagedAttention実装が削除されました。あわせて統一ツールコール/推論パース基盤「Streaming Parser Engine」の追加、異種語彙対応の投機的デコード、複数の新モデル対応など、232名のコントリビューターによる558件のコミットが取り込まれています。

Hugging Face Jobs、vLLMサーバーをたった1コマンドで起動可能に

Hugging Face Blog重要度 65掲載 2026/7/11 23:52

ワンポイントvLLMサーバーがHF Jobsでついに1コマンド起動可能に

Hugging Face公式ブログにて、Hugging Face Jobs上でvLLMサーバーを1コマンドで起動できるようになったことが発表されました。今回公開された記事は「Run a vLLM Server on HF Jobs in One Command」というタイトルのみで、具体的な手順や対応環境などの詳細本文は現時点で確認できません。

Hugging Face、vLLMのtransformersバックエンドをネイティブ実装並みの速度に高速化

Hacker News (trusted domains)重要度 75掲載 2026/7/10 01:54

ワンポイントtransformersのvLLMバックエンドがネイティブ実装並みの推論速度に到達

Hugging Faceは、vLLM上でtransformersのモデル実装を利用する「transformersモデリングバックエンド」を改良し、vLLM専用に書かれたネイティブ実装と同等かそれ以上の推論速度を実現したと発表しました。torch.fxによる静的解析とASTによるコード書き換えで、推論に最適化されたレイヤー融合を実行時に自動適用する仕組みです。Qwen3の複数モデルでの検証結果や、開発者への実務的な影響を紹介します。

vLLM v0.24.0公開——MiniMax-M3/DeepSeek-V4対応強化とデバイス選択方式の刷新

vLLM重要度 75掲載 2026/7/8 19:21

ワンポイントCUDA_VISIBLE_DEVICES自動設定を廃止、device_ids引数へ移行

vLLMプロジェクトはv0.24.0をリリースしました。256人のコントリビューターによる571件のコミットが取り込まれ、MiniMax-M3への新規対応やDeepSeek-V4の性能最適化、Model Runner V2の機能拡張、そしてCUDA_VISIBLE_DEVICESの内部設定廃止などが盛り込まれています。あわせて複数のセキュリティ修正も実施されました。