Hugging Face、拡散パイプラインを部品化する「Modular Diffusers」を発表
Hugging Faceは公式ブログで「Modular Diffusers」を発表しました。タイトルが示す通り、拡散モデルのパイプラインを組み合わせ可能な部品(building blocks)として扱う新しいアプローチです。今回参照した原文には見出し以降の本文が含まれておらず、具体的な機能やAPI仕様までは確認できませんでした。
トピック別に新着順で読めます。「あのアップデート何だっけ」はキーワード・期間からも探せます。
Hugging Faceは公式ブログで「Modular Diffusers」を発表しました。タイトルが示す通り、拡散モデルのパイプラインを組み合わせ可能な部品(building blocks)として扱う新しいアプローチです。今回参照した原文には見出し以降の本文が含まれておらず、具体的な機能やAPI仕様までは確認できませんでした。
Hugging FaceがロボティクスライブラリLeRobotの新バージョン「v0.5.0」を公開しました。リリースタイトルは「Scaling Every Dimension」で、複数の面での拡張を打ち出していますが、今回参照した原文には具体的な変更点の本文が含まれていませんでした。続報や公式ブログの更新を確認する必要があります。

Hugging Faceのブログに、AWS上で基盤モデルの学習と推論を行うための構成要素(ビルディングブロック)を紹介する記事が掲載されました。タイトルからは、AWSとHugging Faceの連携によって基盤モデル開発を支える具体的な技術要素が取り上げられていることがわかります。詳細な内容については原文の本文情報が確認できませんでした。
Hugging Faceが開発したテンソル保存フォーマット「Safetensors」が、PyTorch Foundationの傘下プロジェクトとして参加することが、Hugging Face公式ブログで明らかになりました。詳細な移行内容は今後の発表を待つ必要がありますが、機械学習エコシステムにおけるガバナンスの一歩として注目されます。
Google DeepMindは、分散環境でのAIモデル訓練を扱う新手法「Decoupled DiLoCo」をブログで公表しました。既存のDiLoCoの流れを引く取り組みとして、通信が不安定な環境下でも訓練を継続できる耐障害性を高めることを目指すものです。原文では詳細な技術説明が十分に示されていないため、本記事では公表されたタイトルと概要の範囲に限定して紹介します。
Modularが推論エンジンMAXの新バージョン26.3と、プログラミング言語Mojoの1.0ベータ1をリリースしました。MAXでは動画生成モデルへの対応やマルチGPU向けPython APIが加わり、Mojoではコンパイル時の型絞り込みなど言語仕様の大きな刷新が行われています。
Hugging FaceのTransformersライブラリがv5.9.0をリリースしました。CohereのMoEモデル「Command A+」やHierarchical Reasoning Modelを言語モデル向けに改良した「HRM-Text」など新モデルが追加されたほか、SAM3系モデルの入力仕様に破壊的変更が加わっています。音声・生成周りの不具合修正や継続的バッチ処理へのテンソル並列対応など、実運用に関わる改善も多数含まれています。

Redisブログが公開した記事「Does quantization speed up inference?」は、大規模言語モデル運用のコスト増大を背景に、量子化という定番の軽量化・高速化テクニックが実際に効果を発揮するのかを問い直す内容です。GPU利用時間やメモリ消費、運用コストがアプリの成長とともに膨らむ現実を踏まえ、量子化の位置づけを見つめ直しています。

Hugging FaceがNVIDIAとの協業により、NeMo AutomodelとDiffusersライブラリを組み合わせて動画・画像生成モデルを大規模にファインチューニングする取り組みを発表しました。詳細な技術仕様は原文に記載がないため、ここでは発表の概要のみをお伝えします。

Hugging FaceのブログにMultiverse Computingが投稿した記事「Making Knowledge Distillation Cheap Enough to Run at Scale」を紹介します。知識蒸留のコストを下げ、大規模に運用できるようにする取り組みがテーマとされていますが、今回参照した原文には本文の詳細な記述が含まれていなかったため、具体的な手法や数値には触れず、記事のテーマと背景のみを整理します。
研究者Sidharth GN氏が、テキストキャプションから10.24秒の音声を生成する約1.6億パラメータのLatent Diffusion Transformer「QaDiT」をHugging Faceで公開しました。学習コストはわずか18ドルで、AudioCapsデータセットを用いて2万4千ステップ学習されています。音声合成の研究用途向けに、再現可能な小規模ベースラインとして提供されています。
Lightricksがオープンウェイトの動画・音声生成モデル「LTX-2.5」をHugging Faceで公開しました。従来は単一ショットしか作れなかったのに対し、キャラクターや照明を保ったまま複数カットを連続生成できる「マルチショット生成」が新たに加わっています。自前インフラでのセルフホストとファインチューニングが可能で、年間売上1000万ドル未満であればLTX-2.xコミュニティライセンスのもと商用利用も無償で行えます。

NVIDIAがHugging Face Blogに「The State of Simulation for Physical AI: An Overview」というタイトルの記事を公開しました。ロボットや自律システムなど、物理世界とやり取りする『Physical AI』領域におけるシミュレーション技術の全体像を概観する内容とみられます。今回参照した原文には本文が含まれておらず、詳細な内容は確認できませんでした。
OpenAIの公式ブログに「Scientific computing in the age of agentic AI」と題する記事が公開され、Hacker Newsで27ポイント・9件のコメントを集めています。ただし現時点で確認できた原文情報はタイトルと議論へのリンクのみで、具体的な発表内容の詳細は不明です。
vLLMプロジェクトはv0.24.0をリリースしました。256人のコントリビューターによる571件のコミットが取り込まれ、MiniMax-M3への新規対応やDeepSeek-V4の性能最適化、Model Runner V2の機能拡張、そしてCUDA_VISIBLE_DEVICESの内部設定廃止などが盛り込まれています。あわせて複数のセキュリティ修正も実施されました。