
TL;DR — ComfyUI 動画生成の主流は、1 枚絵を動かす image-to-video。ローカルで回すなら Wan 2.2 や HunyuanVideo などオープン重みモデルに 12〜24GB 以上の VRAM が要る。クラウドなら環境構築ゼロで、1 枚絵を動かす Wan 2.2 の i2v が 45cr (¥45)、文章から作る LTX-Video 13B なら 5 秒 30cr (¥30)。どちらも新規登録の無料 100 クレジットの範囲で回せるので、まずはそれで動きの方向性を確認し、本番だけ高品質モデルに回すのが安上がりだ。
「ComfyUI で動画も作れるらしい」と聞いて試したものの、VRAM 不足やビルドの沼で止まってしまった——そんな人は少なくない。「結局どのモデルがおすすめなのか」も分かりにくい。この記事では ComfyUI 動画生成の使い方を、必要な機材・2026 年時点のおすすめモデル選び・1 本あたりのコストまで初心者向けに整理する。
ComfyUI 動画生成には何が必要?
そもそも ComfyUI 自体がよく分からないという場合は、ComfyUIとは何か・できること・始め方 を先に読むと以降が早い。
ComfyUI 動画生成の主役は「1 枚の静止画を動かす」image-to-video (i2v) だ。アニメの立ち絵や生成したイラストをアップロードし、動きを指定すると数秒の動画になる。text-to-video (t2v、文章から直接動画) もあるが、キャラの見た目を固定しやすい i2v のほうが初心者には扱いやすい。
必要なものは 3 つに整理できる。
- モデル — Wan 2.2 (オープン重み)、HunyuanVideo 1.5 (同)、LTX-Video (同)、Kling・Seedance (API/クラウド専用) などの動画生成モデル
- ワークフロー — ComfyUI 公式が Wan 2.2 のネイティブワークフローを配布している
- GPU の VRAM — ここが最大の関門
ComfyUI 公式の Wan 2.2 チュートリアルによると、軽量な 5B モデルは FP8 で約 8〜12GB に収まる。一方で品質の高い 14B モデルを FP16 でフル稼働させると、text encoder 込みで 54〜65GB にも達する。
VRAM 早見表 (Wan 2.2 をローカルで動かす場合)
GGUF 量子化と T5-XXL テキストエンコーダの CPU オフロードを組み合わせれば、14B でも GPU 側は 6〜8GB まで下げられ、RTX 4070 (12GB) でも 480p なら回せる。ただし下の表のとおり、実用度は構成でかなり変わる。
| 構成 | GPU VRAM の目安 | system RAM | 実用度 |
|---|---|---|---|
| Wan 2.2 5B (FP8) | 約 8〜12GB | 16GB+ | 気軽に試せる |
| Wan 2.2 14B + GGUF量子化 + T5 CPUオフロード | 約 6〜8GB (480p) | 24〜32GB | 動くが 1 本 10〜15 分・忍耐が要る |
| Wan 2.2 14B (FP16 フル) | 54〜65GB | 64GB+ | 事実上データセンター級 GPU が前提 |
「とりあえず試したい」段階でフル構成を組むのは重い。1 本の生成に 10〜15 分かかることも珍しくなく、ここで多くの人が離脱する。
VRAM が足りない場合の対処 (CUDA out of memory)
上の早見表どおりの構成を組んでも、解像度・フレーム数・バッチ数を欲張ると torch.cuda.OutOfMemoryError (CUDA out of memory) で生成が止まることがある。試す順番はこの 3 つ。
- 起動引数を 1 段階ずつ試す —
--lowvramで足りなければ--novram(生成は遅くなるが、4GB クラスの GPU でも完走できる)。動画ワークフローのように複数モデルを切り替える場合は、モデルを VRAM に留めず積極的に system RAM へ逃がす--disable-smart-memoryも効きやすい。各引数の意味は ComfyUI 公式リポジトリの起動引数定義 で確認できる。 - 解像度・フレーム数・バッチサイズを下げる — まず 480p・3〜5 秒・batch=1 まで落として完走を優先し、方向性が固まってから戻す。
- それでも落ちる、または 1 本 10〜15 分の待ちに付き合えないなら、クラウドに切り替えたほうが早い — GPU 側の VRAM 制約自体が無くなる。ローカルとクラウドの損益分岐で、どちらが得か数字で確認できる。
Wan・Kling・Seedance… 主要モデルの現況 (2026 年)
ComfyUI 動画生成で名前が挙がる主要モデルは、性格がはっきり分かれる。2026 年は「ネイティブ音声」「参照入力でのキャラ一貫性」「native 4K」が一気に標準化し、用途ごとの最適モデルが変わった。まず押さえるべきは、オープン重み (ローカルに落として動かせる) か、API/クラウド専用か の違いだ。
| モデル | 開発元 | 重み / 入手性 | 2026 年時点の位置づけ |
|---|---|---|---|
| Wan 2.2 | Alibaba | オープン (ローカル可) | image-to-video の定番オープンモデル。穏やかな動きが得意。2.5 以降は音声・1080p を追加した一方、提供は商用 API 中心に移行 |
| Kling 3.0 | Kuaishou | 商用 API | 2026-02-04 公開。最長 15 秒・native 4K/60fps・音声同時生成。大きな動き / シネマ表現の先頭集団 |
| Seedance 2.0 | ByteDance | 商用 API | 2026-02 公開。独立系の動画アリーナで t2v/i2v 首位級と評価。2.5 (30 秒・4K) を 2026-06 に予告 |
| HunyuanVideo 1.5 | Tencent | オープン | オープン重み中トップクラスの動き・物理整合性。480p |
| LTX-Video (2B / 13B) | Lightricks | オープン | 軽量・高速。プレビューや動きの方向性チェック向き |
※ 古い解説記事では Kling を「v2.5」、Seedance を「1.5」と書いているものがあるが、2026 年 7 月時点の最新は上表のとおり Kling 3.0 / Seedance 2.0 (2.5 が enterprise beta)。数値・世代は各公式リンクで最新を確認してほしい。
選び方の目安はシンプルだ。
- イラストをふわっと動かしたい → Wan 2.2 の image-to-video
- 爆発・走るなど大きな動き / シネマ表現 → Kling 3.0・Seedance 2.0 Pro のような t2v モデル
- オープン重みでローカル完結したい → Wan 2.2・HunyuanVideo 1.5・LTX-Video
重要なのは、Kling・Seedance は API 提供のクローズドモデルで、自宅 PC に重みを落として動かすことはできない 点。ローカルで完結させたいなら Wan 2.2 / HunyuanVideo / LTX-Video などオープン重みモデルが選択肢になる。モデルごとの深掘り比較はAI 動画モデル徹底比較に、動きを引き出す書き方は動画プロンプトの書き方にまとめてある。
ローカルとクラウド、どちらで動かすべき?
ComfyUI を触って動画生成で挫折する人の多くは、モデルの使い方ではなく VRAM 不足とビルドの沼 でつまずく。ここが分岐点になる。
| 観点 | ローカル ComfyUI | クラウド (ComfyStudio) |
|---|---|---|
| 初期費用 | 高性能 GPU が必須 | 不要 (ブラウザだけ) |
| 使えるモデル | オープン重みのみ (Wan / HunyuanVideo / LTX) | オープン + API/クラウド専用 (Seedance など) |
| 環境構築 | ノード・依存関係・量子化を自力で | ゼロ (ログインして選ぶだけ) |
| 生成の待ち | 1 本 10〜15 分〜 | 数十秒〜数分 |
| 費用感 | 電気代 + GPU 償却 | 1 本あたり従量 (生成前に実額表示) |
| 向く人 | 高 VRAM を持ち、オフライン / プライバシー要件が厳しい人 | すぐ試したい・機材が無い・API モデルも使いたい人 |
クラウドの大きな利点は、オープン重みでない Seedance のような API モデルも同じ画面で使い分けられること。ローカルでは Wan のようなオープンモデルしか動かせないので、表現の幅が頭打ちになりやすい。ローカル/クラウドの損益分岐をもっと数字で見たい人は、ComfyUI クラウド実行とローカルの違いを合わせて読むと整理できる。画像生成ツールそのものの選び方で迷っているなら、ComfyUI と Automatic1111 の違いも参考になる。
ComfyStudio の動画ワークフローと費用
ComfyStudio は ComfyUI のワークフローをクラウドで実行する日本発の AI イラスト生成 SaaS だ。手元の GPU を問わず、ブラウザだけで ComfyUI 動画生成ができる。料金は 1 クレジット = 1 円 の従量課金で、生成ボタンを押す前に 1 本あたりのコストが見えるのが特徴だ。健全 (SFW) 特化のため、R18・実在人物の加工・ディープフェイクには非対応。全プラン商用利用 OK (生成物の権利は利用者)。
現在ブラウザで実行できる動画ワークフローと、その目安コストは次のとおり。
| ワークフロー | モデル | 種別 | 選べる尺 | コスト (5 秒・1cr=¥1) |
|---|---|---|---|---|
| 動画プレビュー (最速お試し) | LTX-Video 13B | text→動画 | 1〜30 秒 | 30cr (¥30) |
| 無料枠で試す (文章から) | MiniMax H3 Max | text→動画 | 5〜15 秒 | 75cr (¥75) |
| 無料枠で試す 1 枚絵アニメ | MiniMax H3 Max | 画像→動画 | 5〜15 秒 | 75cr (¥75) |
| 1 枚絵を動画にする | Wan 2.2 | 画像→動画 | 1〜6 秒 | 45cr (¥45・尺によらず定額) |
| 短尺広告 (音声込み) | Seedance 2.0 Fast | text→動画 | 4〜15 秒 | 360cr (¥360) |
| 高品質 (オープン重み) | HunyuanVideo 1.5 | text→動画 | 1〜5 秒 | 112cr (¥112) |
| ハイエンド (シネマ品質) | Seedance 2.0 Pro | text→動画 | 4〜15 秒 | 453cr (¥453) |
新規登録でもらえる無料 100 クレジットで回せるのは、この表のうち 動画プレビュー LTX (5 秒 30cr)、Wan 2.2 の i2v (45cr)、H3 Max の 2 つ (各 75cr) まで。参照画像を用意しなくていいぶん、最初の 1 本は LTX か H3 Max の t2v がいちばん軽いが、動かしたい絵があるなら Wan 2.2 も無料枠内で試せる。HunyuanVideo 1.5 (112cr) や Kling 3.0 (126cr) 以上になると無料枠では残高が足りず、クレジットの追加購入が必要になる。
コストの仕組みはシンプルだ。動画は 出力する尺 (秒数) に比例 し、上表は 5 秒のときの値になる。10 秒にすれば 2 倍で、たとえば Seedance 2.0 Pro は 5 秒 453cr、10 秒 906cr。例外は Wan 2.2 で、1 本単位の料金なので 1〜6 秒のどれを選んでも 45cr のまま。1cr = 1 円なので、¥45 の動画は文字どおり 45 クレジット。いずれも生成前に尺と本数ぶんの実額が表示され、残高から使った分だけ引かれる。動画は画像 (標準 4cr) より一段コストが高いので、まずは短尺・最速モデルで方向性を固めるのが定石だ。
用途 → モデル 早見表
- とりあえず動くか試す → MiniMax H3 Max (¥75 / 無料枠 100cr で回せる最安。t2v と i2v の両方)
- 描いた 1 枚絵を動かす → Wan 2.2 image-to-video (¥45)
- 音声込みの短尺 SNS 動画 → Seedance 2.0 Fast (¥360)
- オープン重みで高品質に → HunyuanVideo 1.5 (¥112)
- 納品級のシネマショット → Seedance 2.0 Pro (¥453)
ComfyStudio で image-to-video を試す手順
この記事の主役、1 枚絵を動かす i2v (Wan 2.2) の流れはこうだ。
- 画像を用意する — 動かしたいイラストや写真を 1 枚アップロード (SFW のみ)
- 「1 枚絵を動画にする」を選ぶ — Wan 2.2 ベースの image-to-video ワークフロー
- 動きを指定して生成 — カメラの動きと被写体の動きをプロンプトで書いて実行。数十秒〜数分で mp4 が完成
- ダウンロード — 生成物はそのまま SNS リールや VTuber 待機画面に使える
例プロンプト (i2v) —
anime girl waving, gentle wind, 5 seconds, looping(アニメ調の女の子が手を振る/そよ風/5 秒/ループ)。i2v は「入力画像の質」が仕上がりの 8 割を決める。先に画像生成で良い 1 枚を作ってから動かすと安定する。
自分の描いた 1 枚絵が ¥45 で動き出す体験は、ローカルで GPU と格闘していた頃には考えられなかった手軽さだ。生成には無料登録が要るが、Google アカウントなら登録はすぐ完了し、その場で 100 クレジット (無料・クレジットカード不要) が付く (メールアドレスで登録した場合は、メール認証の完了後に付与)。他のモデルの作例は登録前でも生成ギャラリーで見比べられ、ほかのモデルやコストは料金ページで確認できる。Wan 2.2 は 45cr で無料枠に収まるので、100 クレジットのまま 1 枚絵を動かせる。まずは無料枠で 1 枚絵を動かしてみるところから始め、動きの方向性が固まってから上位モデルにクレジットを足すのが無駄がない。
費用を抑える 3 つのコツ
- プレビューで方向性を固める — いきなり高品質モデルで回さず、最安の LTX-Video 13B (5 秒 ¥30) で動き・構図を確認してから本番モデルへ。失敗の作り直しコストが激減する。無料枠 100cr でそのまま試せるのもこのモデルだ。
- 入力画像を先に仕上げる — i2v は元画像の品質がそのまま出る。標準画像生成 (4cr) で納得の 1 枚を作ってから動かす。
- 尺は必要最小に — 動画コストは尺 (秒数) に比例する。まず短い尺で確定し、必要なときだけ長尺・高品質に上げる。


