わずか18ドルで学習された1.6億パラメータのテキスト→音声生成モデル「QaDiT」

Hacker News (trusted domains)重要度 65掲載 2026/8/20 18:24

原文公開: 2026/8/11 03:23

ワンポイント学習コストわずか18ドルのテキスト→音声生成DiTモデル

この記事は Hacker News (trusted domains) の一次情報をもとにAIが再構成したものです。 原文を読む →

研究者Sidharth GN氏が、テキストキャプションから10.24秒の音声を生成する約1.6億パラメータのLatent Diffusion Transformer「QaDiT」をHugging Faceで公開しました。学習コストはわずか18ドルで、AudioCapsデータセットを用いて2万4千ステップ学習されています。音声合成の研究用途向けに、再現可能な小規模ベースラインとして提供されています。

全文を読むには有料プランへの登録が必要です。

プランを見る →