ブログ一覧

ComfyUI動画生成のやり方・おすすめモデル2026|費用とVRAMの目安

2026年6月2日10 分で読める

ComfyUI動画生成のやり方・おすすめモデル2026|費用とVRAMの目安

TL;DR — ComfyUI 動画生成の主流は、1 枚絵を動かす image-to-video。ローカルで回すなら Wan 2.2 や HunyuanVideo などオープン重みモデルに 12〜24GB 以上の VRAM が要る。クラウドなら環境構築ゼロで、1 枚絵を動かす Wan 2.2 の i2v が 45cr (¥45)、文章から作る LTX-Video 13B なら 5 秒 30cr (¥30)。どちらも新規登録の無料 100 クレジットの範囲で回せるので、まずはそれで動きの方向性を確認し、本番だけ高品質モデルに回すのが安上がりだ。

「ComfyUI で動画も作れるらしい」と聞いて試したものの、VRAM 不足やビルドの沼で止まってしまった——そんな人は少なくない。「結局どのモデルがおすすめなのか」も分かりにくい。この記事では ComfyUI 動画生成の使い方を、必要な機材・2026 年時点のおすすめモデル選び・1 本あたりのコストまで初心者向けに整理する。

ComfyUI 動画生成には何が必要?

そもそも ComfyUI 自体がよく分からないという場合は、ComfyUIとは何か・できること・始め方 を先に読むと以降が早い。

ComfyUI 動画生成の主役は「1 枚の静止画を動かす」image-to-video (i2v) だ。アニメの立ち絵や生成したイラストをアップロードし、動きを指定すると数秒の動画になる。text-to-video (t2v、文章から直接動画) もあるが、キャラの見た目を固定しやすい i2v のほうが初心者には扱いやすい。

必要なものは 3 つに整理できる。

ComfyUI 公式の Wan 2.2 チュートリアルによると、軽量な 5B モデルは FP8 で約 8〜12GB に収まる。一方で品質の高い 14B モデルを FP16 でフル稼働させると、text encoder 込みで 54〜65GB にも達する。

VRAM 早見表 (Wan 2.2 をローカルで動かす場合)

GGUF 量子化と T5-XXL テキストエンコーダの CPU オフロードを組み合わせれば、14B でも GPU 側は 6〜8GB まで下げられ、RTX 4070 (12GB) でも 480p なら回せる。ただし下の表のとおり、実用度は構成でかなり変わる。

構成GPU VRAM の目安system RAM実用度
Wan 2.2 5B (FP8)約 8〜12GB16GB+気軽に試せる
Wan 2.2 14B + GGUF量子化 + T5 CPUオフロード約 6〜8GB (480p)24〜32GB動くが 1 本 10〜15 分・忍耐が要る
Wan 2.2 14B (FP16 フル)54〜65GB64GB+事実上データセンター級 GPU が前提

「とりあえず試したい」段階でフル構成を組むのは重い。1 本の生成に 10〜15 分かかることも珍しくなく、ここで多くの人が離脱する。

VRAM が足りない場合の対処 (CUDA out of memory)

上の早見表どおりの構成を組んでも、解像度・フレーム数・バッチ数を欲張ると torch.cuda.OutOfMemoryError (CUDA out of memory) で生成が止まることがある。試す順番はこの 3 つ。

  1. 起動引数を 1 段階ずつ試す — --lowvram で足りなければ --novram (生成は遅くなるが、4GB クラスの GPU でも完走できる)。動画ワークフローのように複数モデルを切り替える場合は、モデルを VRAM に留めず積極的に system RAM へ逃がす --disable-smart-memory も効きやすい。各引数の意味は ComfyUI 公式リポジトリの起動引数定義 で確認できる。
  2. 解像度・フレーム数・バッチサイズを下げる — まず 480p・3〜5 秒・batch=1 まで落として完走を優先し、方向性が固まってから戻す。
  3. それでも落ちる、または 1 本 10〜15 分の待ちに付き合えないなら、クラウドに切り替えたほうが早い — GPU 側の VRAM 制約自体が無くなる。ローカルとクラウドの損益分岐で、どちらが得か数字で確認できる。
無料のまま、動画を 1 本つくるカード不要・100クレジット無料
無料で動画をつくる

Wan・Kling・Seedance… 主要モデルの現況 (2026 年)

ComfyUI 動画生成で名前が挙がる主要モデルは、性格がはっきり分かれる。2026 年は「ネイティブ音声」「参照入力でのキャラ一貫性」「native 4K」が一気に標準化し、用途ごとの最適モデルが変わった。まず押さえるべきは、オープン重み (ローカルに落として動かせる) か、API/クラウド専用か の違いだ。

モデル開発元重み / 入手性2026 年時点の位置づけ
Wan 2.2Alibabaオープン (ローカル可)image-to-video の定番オープンモデル。穏やかな動きが得意。2.5 以降は音声・1080p を追加した一方、提供は商用 API 中心に移行
Kling 3.0Kuaishou商用 API2026-02-04 公開。最長 15 秒・native 4K/60fps・音声同時生成。大きな動き / シネマ表現の先頭集団
Seedance 2.0ByteDance商用 API2026-02 公開。独立系の動画アリーナで t2v/i2v 首位級と評価。2.5 (30 秒・4K) を 2026-06 に予告
HunyuanVideo 1.5Tencentオープンオープン重み中トップクラスの動き・物理整合性。480p
LTX-Video (2B / 13B)Lightricksオープン軽量・高速。プレビューや動きの方向性チェック向き

※ 古い解説記事では Kling を「v2.5」、Seedance を「1.5」と書いているものがあるが、2026 年 7 月時点の最新は上表のとおり Kling 3.0 / Seedance 2.0 (2.5 が enterprise beta)。数値・世代は各公式リンクで最新を確認してほしい。

選び方の目安はシンプルだ。

  • イラストをふわっと動かしたい → Wan 2.2 の image-to-video
  • 爆発・走るなど大きな動き / シネマ表現 → Kling 3.0・Seedance 2.0 Pro のような t2v モデル
  • オープン重みでローカル完結したい → Wan 2.2・HunyuanVideo 1.5・LTX-Video

重要なのは、Kling・Seedance は API 提供のクローズドモデルで、自宅 PC に重みを落として動かすことはできない 点。ローカルで完結させたいなら Wan 2.2 / HunyuanVideo / LTX-Video などオープン重みモデルが選択肢になる。モデルごとの深掘り比較はAI 動画モデル徹底比較に、動きを引き出す書き方は動画プロンプトの書き方にまとめてある。

ローカルとクラウド、どちらで動かすべき?

ComfyUI を触って動画生成で挫折する人の多くは、モデルの使い方ではなく VRAM 不足とビルドの沼 でつまずく。ここが分岐点になる。

観点ローカル ComfyUIクラウド (ComfyStudio)
初期費用高性能 GPU が必須不要 (ブラウザだけ)
使えるモデルオープン重みのみ (Wan / HunyuanVideo / LTX)オープン + API/クラウド専用 (Seedance など)
環境構築ノード・依存関係・量子化を自力でゼロ (ログインして選ぶだけ)
生成の待ち1 本 10〜15 分〜数十秒〜数分
費用感電気代 + GPU 償却1 本あたり従量 (生成前に実額表示)
向く人高 VRAM を持ち、オフライン / プライバシー要件が厳しい人すぐ試したい・機材が無い・API モデルも使いたい人

クラウドの大きな利点は、オープン重みでない Seedance のような API モデルも同じ画面で使い分けられること。ローカルでは Wan のようなオープンモデルしか動かせないので、表現の幅が頭打ちになりやすい。ローカル/クラウドの損益分岐をもっと数字で見たい人は、ComfyUI クラウド実行とローカルの違いを合わせて読むと整理できる。画像生成ツールそのものの選び方で迷っているなら、ComfyUI と Automatic1111 の違いも参考になる。

ComfyStudio の動画ワークフローと費用

ComfyStudio は ComfyUI のワークフローをクラウドで実行する日本発の AI イラスト生成 SaaS だ。手元の GPU を問わず、ブラウザだけで ComfyUI 動画生成ができる。料金は 1 クレジット = 1 円 の従量課金で、生成ボタンを押す前に 1 本あたりのコストが見えるのが特徴だ。健全 (SFW) 特化のため、R18・実在人物の加工・ディープフェイクには非対応。全プラン商用利用 OK (生成物の権利は利用者)。

現在ブラウザで実行できる動画ワークフローと、その目安コストは次のとおり。

ワークフローモデル種別選べる尺コスト (5 秒・1cr=¥1)
動画プレビュー (最速お試し)LTX-Video 13Btext→動画1〜30 秒30cr (¥30)
無料枠で試す (文章から)MiniMax H3 Maxtext→動画5〜15 秒75cr (¥75)
無料枠で試す 1 枚絵アニメMiniMax H3 Max画像→動画5〜15 秒75cr (¥75)
1 枚絵を動画にするWan 2.2画像→動画1〜6 秒45cr (¥45・尺によらず定額)
短尺広告 (音声込み)Seedance 2.0 Fasttext→動画4〜15 秒360cr (¥360)
高品質 (オープン重み)HunyuanVideo 1.5text→動画1〜5 秒112cr (¥112)
ハイエンド (シネマ品質)Seedance 2.0 Protext→動画4〜15 秒453cr (¥453)

新規登録でもらえる無料 100 クレジットで回せるのは、この表のうち 動画プレビュー LTX (5 秒 30cr)、Wan 2.2 の i2v (45cr)、H3 Max の 2 つ (各 75cr) まで。参照画像を用意しなくていいぶん、最初の 1 本は LTX か H3 Max の t2v がいちばん軽いが、動かしたい絵があるなら Wan 2.2 も無料枠内で試せる。HunyuanVideo 1.5 (112cr) や Kling 3.0 (126cr) 以上になると無料枠では残高が足りず、クレジットの追加購入が必要になる。

コストの仕組みはシンプルだ。動画は 出力する尺 (秒数) に比例 し、上表は 5 秒のときの値になる。10 秒にすれば 2 倍で、たとえば Seedance 2.0 Pro は 5 秒 453cr、10 秒 906cr。例外は Wan 2.2 で、1 本単位の料金なので 1〜6 秒のどれを選んでも 45cr のまま。1cr = 1 円なので、¥45 の動画は文字どおり 45 クレジット。いずれも生成前に尺と本数ぶんの実額が表示され、残高から使った分だけ引かれる。動画は画像 (標準 4cr) より一段コストが高いので、まずは短尺・最速モデルで方向性を固めるのが定石だ。

用途 → モデル 早見表

  • とりあえず動くか試す → MiniMax H3 Max (¥75 / 無料枠 100cr で回せる最安。t2v と i2v の両方)
  • 描いた 1 枚絵を動かす → Wan 2.2 image-to-video (¥45)
  • 音声込みの短尺 SNS 動画 → Seedance 2.0 Fast (¥360)
  • オープン重みで高品質に → HunyuanVideo 1.5 (¥112)
  • 納品級のシネマショット → Seedance 2.0 Pro (¥453)

ComfyStudio で image-to-video を試す手順

この記事の主役、1 枚絵を動かす i2v (Wan 2.2) の流れはこうだ。

  1. 画像を用意する — 動かしたいイラストや写真を 1 枚アップロード (SFW のみ)
  2. 「1 枚絵を動画にする」を選ぶ — Wan 2.2 ベースの image-to-video ワークフロー
  3. 動きを指定して生成 — カメラの動きと被写体の動きをプロンプトで書いて実行。数十秒〜数分で mp4 が完成
  4. ダウンロード — 生成物はそのまま SNS リールや VTuber 待機画面に使える

例プロンプト (i2v) — anime girl waving, gentle wind, 5 seconds, looping (アニメ調の女の子が手を振る/そよ風/5 秒/ループ)。i2v は「入力画像の質」が仕上がりの 8 割を決める。先に画像生成で良い 1 枚を作ってから動かすと安定する。

自分の描いた 1 枚絵が ¥45 で動き出す体験は、ローカルで GPU と格闘していた頃には考えられなかった手軽さだ。生成には無料登録が要るが、Google アカウントなら登録はすぐ完了し、その場で 100 クレジット (無料・クレジットカード不要) が付く (メールアドレスで登録した場合は、メール認証の完了後に付与)。他のモデルの作例は登録前でも生成ギャラリーで見比べられ、ほかのモデルやコストは料金ページで確認できる。Wan 2.2 は 45cr で無料枠に収まるので、100 クレジットのまま 1 枚絵を動かせる。まずは無料枠で 1 枚絵を動かしてみるところから始め、動きの方向性が固まってから上位モデルにクレジットを足すのが無駄がない。

費用を抑える 3 つのコツ

  • プレビューで方向性を固める — いきなり高品質モデルで回さず、最安の LTX-Video 13B (5 秒 ¥30) で動き・構図を確認してから本番モデルへ。失敗の作り直しコストが激減する。無料枠 100cr でそのまま試せるのもこのモデルだ。
  • 入力画像を先に仕上げる — i2v は元画像の品質がそのまま出る。標準画像生成 (4cr) で納得の 1 枚を作ってから動かす。
  • 尺は必要最小に — 動画コストは尺 (秒数) に比例する。まず短い尺で確定し、必要なときだけ長尺・高品質に上げる。

よくある質問

ComfyUI 動画生成にはどのくらいの VRAM が必要ですか?
Wan 2.2 の 5B は FP8 で約 8〜12GB、14B を FP16 で回すと text encoder 込みで 54〜65GB 必要です。GGUF 量子化と T5-XXL の CPU オフロードを使えば 12GB クラスの GPU でも 480p なら動きますが、system RAM は 24〜32GB を推奨します。VRAM に不安があるならクラウド実行が無難です。
画像を動画にする image-to-video では何ができますか?
アップロードした 1 枚のイラストや写真を、プロンプトで指定した動きに沿ってアニメーションさせる機能です。Wan 2.2 は静止画に近い穏やかな動きが得意で、SNS リールや VTuber の待機画面づくりに向きます。走る・爆発するような大きな動きが欲しいときは、text-to-video のシネマ系モデル (Seedance 2.0 Pro など) が向きます。
ComfyUI を入れなくても動画生成はできますか?
はい。ComfyStudio のようなクラウド型 SaaS なら、ComfyUI のインストールや GPU の用意なしに、ブラウザだけで ComfyUI 動画生成のワークフローを実行できます。ローカルで動くオープン重みの Wan 2.2 / HunyuanVideo / LTX-Video に加え、API/クラウド専用の Seedance 2.0 も同じ画面で使い分けられるのが利点です。
動画生成は 1 本いくらかかりますか?
ComfyStudio は 1 クレジット = 1 円で、Wan 2.2 の image-to-video が 45cr (¥45)、ハイエンドの Seedance 2.0 Pro が 5 秒 453cr (¥453) など、生成ボタンを押す前に 1 本あたりのコストが表示されます。使った分だけの従量課金なので、月額固定のサービスより少額から試せます。新規登録時の無料 100 クレジットの範囲でも、LTX-Video 13B (5 秒 30cr)、Wan 2.2 の i2v (45cr)、MiniMax H3 Max (480P・5 秒 75cr) を追加購入なしで試せます。
ComfyUI 動画生成でおすすめのモデルはどれですか?
「とりあえず動くか試したい」なら無料枠にも収まる MiniMax H3 Max か LTX-Video 13B。「描いた 1 枚絵を動かしたい」なら Wan 2.2 の image-to-video。「爆発・走るなど大きな動きやシネマ表現」が欲しいなら Kling 3.0・Seedance 2.0 Pro のような API 専用モデルがおすすめです。自宅 PC にオープン重みを落として動かしたいなら Wan 2.2・HunyuanVideo 1.5・LTX-Video の 3 択に絞られます。
ComfyUI 動画生成のワークフローはどこで手に入りますか?
ローカルで動かすなら、Wan 2.2 のネイティブワークフローはComfyUI 公式のチュートリアルから入手できます。ノードの追加設定や依存関係の解決なしで今すぐ試したい場合は、ComfyStudio のようなクラウド型 SaaS ならワークフローが選択式ですでに組まれており、画像をアップロードして動きを指定するだけで実行できます。
ComfyUI の動画生成で「CUDA out of memory」が出たらどうすればいいですか?
起動引数の --lowvram (それでも落ちるなら --novram) を試すか、解像度・フレーム数・バッチサイズを下げて完走を優先します。複数モデルを切り替えるワークフローでは、モデルを system RAM へ積極的に逃がす --disable-smart-memory も有効です (定義は ComfyUI 公式リポジトリの cli_args.py で確認できます)。それでも失敗が続く、または待ち時間が負担なら、GPU の VRAM 制約が無いクラウド実行に切り替えるのも手です。
Start Free
無料のまま、動画を 1 本つくる

登録だけで 100 クレジット。 この記事で使っている MiniMax H3 Max は 75 クレジットなので、 追加の支払いなしで 1 本つくれます。カード登録は不要です。

関連記事