わずか18ドルで学習された1.6億パラメータのテキスト→音声生成モデル「QaDiT」
ワンポイント学習コストわずか18ドルのテキスト→音声生成DiTモデル
この記事は Hacker News (trusted domains) の一次情報をもとにAIが再構成したものです。 原文を読む →
研究者Sidharth GN氏が、テキストキャプションから10.24秒の音声を生成する約1.6億パラメータのLatent Diffusion Transformer「QaDiT」をHugging Faceで公開しました。学習コストはわずか18ドルで、AudioCapsデータセットを用いて2万4千ステップ学習されています。音声合成の研究用途向けに、再現可能な小規模ベースラインとして提供されています。
全文を読むには有料プランへの登録が必要です。
プランを見る →