MiniMax、テキスト・画像・動画・音声を統合理解する新モデル「MiniMax-H3」をHugging Faceで公開

Hacker News (trusted domains)重要度 72原文公開: 2026/8/3

ワンポイント最大2K・15秒のステレオ音声付き動画を生成する新モデルが登場

この記事は Hacker News (trusted domains) の一次情報をもとにAIが再構成したものです。 原文を読む →

MiniMaxがHugging Faceにて、omni-modal生成モデル「MiniMax-H3」の重みを公開しました。テキスト・画像・動画・音声を統合的に理解し、最大2K解像度・15秒のステレオ音声付き動画を生成できます。SGLangやvLLM、diffusersなどでのローカル推論に対応し、APIやWebアプリからも利用可能です。

全文を読むには有料プランへの登録が必要です。

プランを見る →