Primary Sources Only

公式ブログとリリースノートを、日本語の記事にして毎朝届けます。

まとめサイトの記事や機械翻訳ではなく、一次情報だけを追っています。興味のあるトピックだけ選んで読めます。

トピック: transformers解除

Qwen3.8登場、2.4兆パラメータMoEでOpenモデルが「Maxクラス」に到達

Hacker News (trusted domains)重要度 75掲載 2026/8/19 04:51

ワンポイント活性化95Bで動く2.4兆パラメータMoEがオープン公開

AlibabaのQwenチームが、オープンモデルとして初めて「Qwen-Maxクラス」の性能を実現した新モデル「Qwen3.8-2.4T-A95B」をHugging Faceで公開しました。総パラメータ2.4兆・活性化95BのMoE構成で、コーディングや長時間の自律エージェントタスクに強みを持ちます。vLLMやSGLangなど既存の推論基盤にもそのまま対応しています。

MiniMax、最長5分の完全な楽曲を生成できるAIモデル「MiniMax Music 3」を公開

Hacker News (trusted domains)重要度 72掲載 2026/8/19 02:24

ワンポイント歌詞と説明文から最長5分の完成曲を生成、8GB VRAMでも動作

MiniMaxAIがHugging Face上で音楽生成モデル「MiniMax Music 3」を公開しました。歌詞と詳細な音楽記述から、イントロからアウトロまで構成が破綻しない最長5分の完全な楽曲を32kHzステレオWAVで生成できます。SGLang-Omniやdiffusersでの推論に対応し、8GBのVRAMでも動作可能です。

9.36MパラメータでローカルTTSが完結、個人開発のInflect-Micro-v2が公開

Hacker News (trusted domains)重要度 60掲載 2026/8/4 06:23

ワンポイントわずか936万パラメータでローカル動作するTTSモデルが登場

開発者Owen Songが独自に開発・資金提供したテキスト読み上げモデル「Inflect-Micro-v2」がHugging Faceで公開されました。パラメータ数は9,356,513、FP32重みで37.53MBという軽量さながら、24kHzモノラル音声を生成できます。より小型の姉妹モデルInflect-Nano-v2と共通APIを持ち、CPU/CUDA双方でのローカル推論やONNX Runtime版も用意されています。

わずか390万パラメータで動く軽量TTS「Inflect-v2」がHugging Faceに登場

Hacker News (trusted domains)重要度 72掲載 2026/8/4 06:22

ワンポイント390万パラメータのTTSがCPUで実用品質を実現

開発者Nymboが、390万・930万パラメータという極小サイズの英語向けオープンウェイトTTSモデル「Inflect-v2」を公開しました。CPU上でリアルタイムを大きく上回る速度で音声合成でき、既存の軽量TTSと同等の品質を実現しているとして、コミュニティから驚きの声が上がっています。ライセンスはApache 2.0で、モデルとデモが公開されています。

vLLM v0.26.0リリース、DeepSeek-V4の推論性能を大幅強化しセキュリティ修正も多数実施

vLLM重要度 75掲載 2026/8/4 06:22

ワンポイントDeepSeek-V4のTPOTが最大2.94%改善、pickle脆弱性も排除

vLLMのv0.26.0がリリースされ、212人のコントリビューターによる411件のコミットが取り込まれました。新モデルファミリー「Inkling」の追加、DeepSeek-V4向けの推論カーネル最適化、KVキャッシュオフロード機能の成熟化に加え、pickleデシリアライズの脆弱性排除などセキュリティ修正も行われています。

MiniMax、テキスト・画像・動画・音声を統合理解する新モデル「MiniMax-H3」をHugging Faceで公開

Hacker News (trusted domains)重要度 72掲載 2026/8/4 02:23

ワンポイント最大2K・15秒のステレオ音声付き動画を生成する新モデルが登場

MiniMaxがHugging Faceにて、omni-modal生成モデル「MiniMax-H3」の重みを公開しました。テキスト・画像・動画・音声を統合的に理解し、最大2K解像度・15秒のステレオ音声付き動画を生成できます。SGLangやvLLM、diffusersなどでのローカル推論に対応し、APIやWebアプリからも利用可能です。

Microsoft、ブラウザ操作AI「Fara1.5-27B」を公開 Qwen3.5-27Bをファインチューニング

Hacker News (trusted domains)重要度 72掲載 2026/8/1 16:53

ワンポイントWeb操作AI「Fara1.5-27B」、決済など不可逆操作は必ず人に確認

Microsoft Research AI Frontiersが、Webブラウザを画面キャプチャだけで操作するマルチモーダルAIエージェント「Fara1.5-27B」をHugging Faceで公開しました。Qwen3.5-27Bをベースにファインチューニングされ、フォーム入力や予約、買い物などのタスクをスクリーンショットの観察とクリック・入力といったツール呼び出しだけで完遂します。個人情報入力や決済など不可逆な操作の前には必ずユーザー確認を挟む安全設計も特徴です。

LiquidAI、CPU向け長文脈エンコーダ「LFM2.5-Encoders」を発表

Hugging Face Blog重要度 72掲載 2026/8/1 08:53

ワンポイントCPUでも長文脈を高速処理できる新エンコーダが登場

LiquidAIがHugging Face Blogを通じて、CPU環境での長文脈(long-context)推論を高速に行うことを目的とした新しいエンコーダモデル群「LFM2.5-Encoders」を公開しました。GPUに依存しない推論環境での活用を意識したモデルである点が特徴です。

「チャットボットを超えて」Direct Preference Optimizationの適用領域を問うHugging Faceの記事

Hugging Face Blog重要度 65掲載 2026/7/14 16:54

ワンポイントDPOをチャットボット以外にも広げる可能性を提起した記事

Hugging Faceのブログに、Direct Preference Optimization(DPO)をチャットボット向けの対話調整に限らず活用する可能性を論じた記事「Direct Preference Optimization Beyond Chatbots」が公開されました。今回は原文本文が公開情報として提供されていないため、タイトルと出典情報に基づいた紹介となります。

Transformers v5.10.1リリース ― 破損ブランチによるv5.10.0撤回と新モデル4種を追加

Transformers (Hugging Face)重要度 72掲載 2026/7/14 15:24

ワンポイントv5.10.0は破損ブランチのため撤回、v5.10.1で新モデル4種を追加

Hugging FaceのTransformersライブラリでv5.10.1がリリースされました。直前のv5.10.0は破損したブランチから公開されたため撤回(yank)されており、本バージョンがその修正版です。同時にGemma 4 12B Unified、Sapiens2、DeepSeek-OCR-2、Mellumという4つの新モデルサポートも追加されています。

Transformers v5.11.0リリース、拡散型のDiffusionGemmaとDeepSeek-V3.2を追加

Transformers (Hugging Face)重要度 72掲載 2026/7/14 12:53

ワンポイント拡散方式のDiffusionGemmaと685B級DeepSeek-V3.2が新登場

Hugging FaceのTransformersライブラリがv5.11.0を公開し、拡散モデル方式で推論を高速化する新アーキテクチャ「DiffusionGemma」と、スパースアテンションを採用した「DeepSeek-V3.2」を新規サポートしました。カーネル統合APIの拡張や並列推論のバグ修正も含まれています。

DiffusionGemma:テキスト生成を4倍高速化する新モデルをGoogle DeepMindが発表

Google DeepMind Blog重要度 75掲載 2026/7/14 12:52

ワンポイントテキスト生成が4倍速い「DiffusionGemma」をDeepMindが発表

Google DeepMindは「DiffusionGemma」と呼ばれる新しい取り組みを公式ブログで発表しました。タイトルによれば、従来のテキスト生成に比べて**4倍高速な生成**を実現するとされています。ただし今回入手できた原文情報は非常に限られており、具体的な仕組みや検証条件などの詳細は明らかになっていません。

vLLM v0.23.0リリース、DeepSeek-V4の最適化とModel Runner V2の対応拡大が進む

vLLM重要度 75掲載 2026/7/14 09:51

ワンポイントModel Runner V2がLlama・Mistralのdenseモデルにも標準適用

vLLM v0.23.0が公開され、DeepSeek-V4の推論基盤が大幅に強化されるとともに、次世代実行エンジン「Model Runner V2」がLlama・Mistral系のdenseモデルにも標準適用されました。あわせてマルチティアKVキャッシュオフロードや推論・ツール呼び出しパーサーの統一化など、実運用を見据えた改善が多数含まれています。なお本バージョンではMinimax M3はまだサポート対象外です。

LoRAを超えられるか? Hugging Faceが問う次世代ファインチューニング技術の行方

Hugging Face Blog重要度 65掲載 2026/7/13 09:24

ワンポイントLoRAを超えるファインチューニング手法はあるのか、という問いかけ

Hugging Face Blogが「Beyond LoRA: Can you beat the most popular fine-tuning technique?」と題した記事を公開しました。LoRAが事実上の標準となっているパラメータ効率的ファインチューニング(PEFT)の分野において、それを上回る手法が存在するのかを問いかける内容です。本記事執筆時点では詳細な本文内容が提供されていないため、背景と論点の紹介にとどめます。

vLLM v0.25.0リリース、Model Runner V2が標準実行パスに昇格しPagedAttentionを削除

vLLM重要度 80掲載 2026/7/12 16:51

ワンポイントPagedAttention削除、MRv2が全密モデルの標準実行パスに

vLLMのv0.25.0がリリースされ、Model Runner V2(MRv2)がすべての密モデルの標準実行パスとなり、旧来のPagedAttention実装が削除されました。あわせて統一ツールコール/推論パース基盤「Streaming Parser Engine」の追加、異種語彙対応の投機的デコード、複数の新モデル対応など、232名のコントリビューターによる558件のコミットが取り込まれています。

Hugging Face、実環境の音声認識性能を測る「FFASRリーダーボード」を公開

Hugging Face Blog重要度 65掲載 2026/7/12 01:25

ワンポイント実世界条件でASR性能を比較する新リーダーボードが登場

Hugging Faceが、実世界の音声環境における自動音声認識(ASR)モデルの性能を比較するための新しいリーダーボード「FFASR Leaderboard」を発表しました。詳細な評価手法やデータセットの内容は公式ブログの本文で確認できます。

わずか16Mパラメータの追加学習で、Gemini Embedding 2の音声検索を上回るモデルが登場

Hacker News (trusted domains)重要度 72掲載 2026/7/11 18:23

ワンポイント16Mパラメータの追加学習だけでGemini Embedding 2の音声検索を上回った

EximiusLabsが、既存のマルチモーダル埋め込みモデルQwen3-VL-Embedding-2Bに音声モダリティを追加した「fusion-embedding-1-2b-preview」をHugging Faceで公開しました。ベースモデルの重みを一切変更せず、約16Mパラメータの小さな接続層(コネクタ)を学習するだけで、音声↔テキスト検索においてGemini Embedding 2やImageBind、LanguageBindを上回る性能を達成しています。研究プレビュー版としてCC-BY-NC-4.0ライセンスで公開中です。

Hugging Face、vLLMのtransformersバックエンドをネイティブ実装並みの速度に高速化

Hacker News (trusted domains)重要度 75掲載 2026/7/10 01:54

ワンポイントtransformersのvLLMバックエンドがネイティブ実装並みの推論速度に到達

Hugging Faceは、vLLM上でtransformersのモデル実装を利用する「transformersモデリングバックエンド」を改良し、vLLM専用に書かれたネイティブ実装と同等かそれ以上の推論速度を実現したと発表しました。torch.fxによる静的解析とASTによるコード書き換えで、推論に最適化されたレイヤー融合を実行時に自動適用する仕組みです。Qwen3の複数モデルでの検証結果や、開発者への実務的な影響を紹介します。