MiniMax、テキスト・画像・動画・音声を統合理解する新モデル「MiniMax-H3」をHugging Faceで公開
ワンポイント最大2K・15秒のステレオ音声付き動画を生成する新モデルが登場
この記事は Hacker News (trusted domains) の一次情報をもとにAIが再構成したものです。 原文を読む →
MiniMaxがHugging Faceにて、omni-modal生成モデル「MiniMax-H3」の重みを公開しました。テキスト・画像・動画・音声を統合的に理解し、最大2K解像度・15秒のステレオ音声付き動画を生成できます。SGLangやvLLM、diffusersなどでのローカル推論に対応し、APIやWebアプリからも利用可能です。
全文を読むには有料プランへの登録が必要です。
プランを見る →