Qwen3.8登場、2.4兆パラメータMoEでOpenモデルが「Maxクラス」に到達
AlibabaのQwenチームが、オープンモデルとして初めて「Qwen-Maxクラス」の性能を実現した新モデル「Qwen3.8-2.4T-A95B」をHugging Faceで公開しました。総パラメータ2.4兆・活性化95BのMoE構成で、コーディングや長時間の自律エージェントタスクに強みを持ちます。vLLMやSGLangなど既存の推論基盤にもそのまま対応しています。
トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。
AlibabaのQwenチームが、オープンモデルとして初めて「Qwen-Maxクラス」の性能を実現した新モデル「Qwen3.8-2.4T-A95B」をHugging Faceで公開しました。総パラメータ2.4兆・活性化95BのMoE構成で、コーディングや長時間の自律エージェントタスクに強みを持ちます。vLLMやSGLangなど既存の推論基盤にもそのまま対応しています。
MiniMaxAIがHugging Face上で音楽生成モデル「MiniMax Music 3」を公開しました。歌詞と詳細な音楽記述から、イントロからアウトロまで構成が破綻しない最長5分の完全な楽曲を32kHzステレオWAVで生成できます。SGLang-Omniやdiffusersでの推論に対応し、8GBのVRAMでも動作可能です。

開発者Owen Songが独自に開発・資金提供したテキスト読み上げモデル「Inflect-Micro-v2」がHugging Faceで公開されました。パラメータ数は9,356,513、FP32重みで37.53MBという軽量さながら、24kHzモノラル音声を生成できます。より小型の姉妹モデルInflect-Nano-v2と共通APIを持ち、CPU/CUDA双方でのローカル推論やONNX Runtime版も用意されています。
開発者Nymboが、390万・930万パラメータという極小サイズの英語向けオープンウェイトTTSモデル「Inflect-v2」を公開しました。CPU上でリアルタイムを大きく上回る速度で音声合成でき、既存の軽量TTSと同等の品質を実現しているとして、コミュニティから驚きの声が上がっています。ライセンスはApache 2.0で、モデルとデモが公開されています。
vLLMのv0.26.0がリリースされ、212人のコントリビューターによる411件のコミットが取り込まれました。新モデルファミリー「Inkling」の追加、DeepSeek-V4向けの推論カーネル最適化、KVキャッシュオフロード機能の成熟化に加え、pickleデシリアライズの脆弱性排除などセキュリティ修正も行われています。
MiniMaxがHugging Faceにて、omni-modal生成モデル「MiniMax-H3」の重みを公開しました。テキスト・画像・動画・音声を統合的に理解し、最大2K解像度・15秒のステレオ音声付き動画を生成できます。SGLangやvLLM、diffusersなどでのローカル推論に対応し、APIやWebアプリからも利用可能です。
Microsoft Research AI Frontiersが、Webブラウザを画面キャプチャだけで操作するマルチモーダルAIエージェント「Fara1.5-27B」をHugging Faceで公開しました。Qwen3.5-27Bをベースにファインチューニングされ、フォーム入力や予約、買い物などのタスクをスクリーンショットの観察とクリック・入力といったツール呼び出しだけで完遂します。個人情報入力や決済など不可逆な操作の前には必ずユーザー確認を挟む安全設計も特徴です。

LiquidAIがHugging Face Blogを通じて、CPU環境での長文脈(long-context)推論を高速に行うことを目的とした新しいエンコーダモデル群「LFM2.5-Encoders」を公開しました。GPUに依存しない推論環境での活用を意識したモデルである点が特徴です。
Hugging Faceのブログに、Direct Preference Optimization(DPO)をチャットボット向けの対話調整に限らず活用する可能性を論じた記事「Direct Preference Optimization Beyond Chatbots」が公開されました。今回は原文本文が公開情報として提供されていないため、タイトルと出典情報に基づいた紹介となります。
Hugging FaceのTransformersライブラリでv5.10.1がリリースされました。直前のv5.10.0は破損したブランチから公開されたため撤回(yank)されており、本バージョンがその修正版です。同時にGemma 4 12B Unified、Sapiens2、DeepSeek-OCR-2、Mellumという4つの新モデルサポートも追加されています。
Hugging FaceのTransformersライブラリがv5.11.0を公開し、拡散モデル方式で推論を高速化する新アーキテクチャ「DiffusionGemma」と、スパースアテンションを採用した「DeepSeek-V3.2」を新規サポートしました。カーネル統合APIの拡張や並列推論のバグ修正も含まれています。

Google DeepMindは「DiffusionGemma」と呼ばれる新しい取り組みを公式ブログで発表しました。タイトルによれば、従来のテキスト生成に比べて**4倍高速な生成**を実現するとされています。ただし今回入手できた原文情報は非常に限られており、具体的な仕組みや検証条件などの詳細は明らかになっていません。
vLLM v0.23.0が公開され、DeepSeek-V4の推論基盤が大幅に強化されるとともに、次世代実行エンジン「Model Runner V2」がLlama・Mistral系のdenseモデルにも標準適用されました。あわせてマルチティアKVキャッシュオフロードや推論・ツール呼び出しパーサーの統一化など、実運用を見据えた改善が多数含まれています。なお本バージョンではMinimax M3はまだサポート対象外です。
Hugging Face Blogが「Beyond LoRA: Can you beat the most popular fine-tuning technique?」と題した記事を公開しました。LoRAが事実上の標準となっているパラメータ効率的ファインチューニング(PEFT)の分野において、それを上回る手法が存在するのかを問いかける内容です。本記事執筆時点では詳細な本文内容が提供されていないため、背景と論点の紹介にとどめます。
vLLMのv0.25.0がリリースされ、Model Runner V2(MRv2)がすべての密モデルの標準実行パスとなり、旧来のPagedAttention実装が削除されました。あわせて統一ツールコール/推論パース基盤「Streaming Parser Engine」の追加、異種語彙対応の投機的デコード、複数の新モデル対応など、232名のコントリビューターによる558件のコミットが取り込まれています。
Hugging Faceが、実世界の音声環境における自動音声認識(ASR)モデルの性能を比較するための新しいリーダーボード「FFASR Leaderboard」を発表しました。詳細な評価手法やデータセットの内容は公式ブログの本文で確認できます。
EximiusLabsが、既存のマルチモーダル埋め込みモデルQwen3-VL-Embedding-2Bに音声モダリティを追加した「fusion-embedding-1-2b-preview」をHugging Faceで公開しました。ベースモデルの重みを一切変更せず、約16Mパラメータの小さな接続層(コネクタ)を学習するだけで、音声↔テキスト検索においてGemini Embedding 2やImageBind、LanguageBindを上回る性能を達成しています。研究プレビュー版としてCC-BY-NC-4.0ライセンスで公開中です。
Hugging Faceは、vLLM上でtransformersのモデル実装を利用する「transformersモデリングバックエンド」を改良し、vLLM専用に書かれたネイティブ実装と同等かそれ以上の推論速度を実現したと発表しました。torch.fxによる静的解析とASTによるコード書き換えで、推論に最適化されたレイヤー融合を実行時に自動適用する仕組みです。Qwen3の複数モデルでの検証結果や、開発者への実務的な影響を紹介します。