MENU

Stable Diffusionの使い方|ローカル・Web・APIの3つの入口と手順

Stable Diffusionの使い方|ローカル・Web・APIの3つの入口と手順

画像生成AIのStable Diffusionを使ってみたいけれど、調べるほど入口が増えて手が止まる。

そう感じている方に向けて、Stability AIの公式サイトと公式のモデルカード、公式リポジトリに書かれている手順だけを整理しました。

Stable Diffusionには入口が3つあり、どれを選ぶかで手順がまったく変わります

この記事の情報は2026年9月8日時点のものです。

最新の内容は必ずStability AI公式の画像モデルのページでご確認ください。

目次

【結論】Stable Diffusionの使い方は「ローカル・Web・API」の3つに分かれる

結論から書きます。

Stability AIの公式ページは、Stable Diffusion 3.5について ローカル(自分の環境で動かす)・API・Webの3つの入口 を並べて案内しています。

公式ページに置かれている導線は次の3本です。

  • ローカルで動かす=ライセンスに同意してモデルの重みを取得する
  • APIから呼ぶ=Platform APIを使う
  • Webで使う=Stable Assistantから始める

この記事では、どの見出しがどの入口の話なのかを毎回はっきり書き分けます。

自分がどれを使うのかを先に決めてから読み進めてください。

Stable Diffusionの3つの入口を一覧で比較する

公式に書かれている性格の違いを表にしました。

入口公式の窓口必要なもの向いている人
ローカル実行Hugging Faceのモデルカード / 公式GitHubGPU環境とPythonの実行環境設定を細かく触りたい人
APIPlatform API(platform.stability.ai)APIキーと開発環境自分のアプリに組み込みたい人
WebStable Assistantブラウザとアカウントまず画面で試したい人

公式が「まず始めるなら」として挙げているのはStable Assistantです

画像モデルのページに、Stable Assistantから作り始める導線が置かれています。

Stable Diffusionをローカルで使う手順①:diffusersで動かす

ここからはローカル実行の話です。

Hugging Faceの公式モデルカードに載っているコードをそのままなぞる方法が、いちばん短い経路になります。

  1. stabilityai/stable-diffusion-3.5-large のモデルカードを開く
  2. ページ上部の同意欄でライセンスに同意する(同意しないとファイルにアクセスできない)
  3. ターミナルで pip install -U diffusers transformers accelerate を実行する
  4. Pythonから StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large", torch_dtype=torch.bfloat16) でパイプラインを読み込む
  5. pipe.to("cuda") でGPUに載せる(公式の記載どおり、Apple製の端末では “mps” に切り替える)
  6. プロンプトを渡して num_inference_steps=28guidance_scale=3.5 で生成する
  7. 返ってきた画像を image.save("出力名.png") で保存する

ステップ数28とガイダンススケール3.5は、公式モデルカードのサンプルに書かれている値です

まずはこの値のまま回して、出力を見てから動かすのが安全です。

モデルカードには、ローカルや自前ホストで使うならノードベースのUIであるComfyUI、あるいはプログラムから使うならdiffusersかGitHubを推奨する、とも書かれています。

Stable Diffusionをローカルで使う手順②:公式リファレンス実装で動かす

引き続きローカル実行の話です。

Stability AIは、推論だけを行う小さな参照実装を公式のGitHubリポジトリで公開しています。

READMEに書かれている手順は次のとおりです。

  1. Hugging Faceから sd3.5_large.safetensors(またはLarge Turbo、Medium)を models ディレクトリへ入れる
  2. テキストエンコーダーを3つ別々にダウンロードするclip_l.safetensorsclip_g.safetensorst5xxl_fp16.safetensors
  3. python3 -s -m venv .sd3.5 で仮想環境を作る(Windowsは python と打つ、とREADMEに注記あり)
  4. source .sd3.5/bin/activate で仮想環境に入る
  5. python3 -s -m pip install -r requirements.txt で依存関係を入れる
  6. python3 sd3_infer.py --prompt "cute wallpaper art of a cat" で生成する
  7. 出力を確認する(既定の保存先は outputs/<MODEL>/<PROMPT>_<DATETIME>_<POSTFIX>

解像度を変えたいときは --width--height を足します。

ステップ数を変えたいときは --steps を足します。

READMEには、この参照実装はパートナー向けの実装補助が目的であり、別の推論環境が必要ならComfyUIを使うようにと明記されています

Stable Diffusionのモデルはどれを選ぶか(ローカル実行の場合)

ローカルで動かすときは、最初にモデルを選びます。

公式の画像モデルページには3種類が並んでいます。

モデル公式の説明公式のモデルカード
Stable Diffusion 3.5 Largeファミリーで最も強力。品質とプロンプト追従に優れ、1メガピクセルのプロ用途向けHugging Faceで公開
Stable Diffusion 3.5 Large Turbo4ステップで高品質な画像を生成する高速版Hugging Faceで公開
Stable Diffusion 3.5 Medium品質とカスタマイズ性のバランス型。コンシューマー向けハードウェアで動くHugging Faceで公開

自宅のPCで動かすなら、公式が「コンシューマー向けハードウェアで動く」と書いているMediumが出発点になります

各モデルカードはLargeLarge TurboMediumにあります。

公式のGitHubリポジトリには、Mediumで構造や解剖学的な破綻を減らしたいときに --skip_layer_cfg True を付ける方法も書かれています。

他の画像生成サービスと比べたい方はMidjourneyの使い方の記事も参考になります。

Stable DiffusionをWeb版(Stable Assistant)で使う

ここからはWebの入口の話です。

Stable Assistantは、Stability AIが提供している作成ツールです。

公式ページには、Stable AssistantはStable Image Ultraで動いており、これはStable Diffusion 3.5 Largeに高度なワークフローを組み合わせたものだと記載されています。

つまりWebの入口でも、土台になっているのは同じStable Diffusion 3.5 Largeです。

公式ページに列挙されている編集機能は次のとおりです。

  • Search and Replace(探して置き換える)
  • Erase(消す)/Inpaint(描き足す)
  • Remove Background(背景を消す)
  • Zoom Out(外側へ広げる)/Upscale(拡大する)/Enhance(品質を上げる)
  • Sketch to Image(下書きから画像へ)
  • Search and Recolor(探して色を変える)
  • Image to 3D(画像から3Dへ)

手順はStable Assistantのページからログインして始めるだけです。

ローカル環境の構築が不要なので、まず出力の質を確かめたい段階ではここがいちばん速い入口になります

Stable DiffusionをAPIから使う入口

ここからはAPIの入口の話です。

公式のモデルカードには、利用できるAPIエンドポイントとして Stability AI API が挙げられています。

窓口はPlatform API(platform.stability.ai)です。

自分のアプリやワークフローに画像生成を組み込むなら、ローカルにモデルを置かずAPIで呼ぶ形が公式の想定です

この入口ではGPUを自分で用意する必要がありません。

そのかわり、生成のたびにAPI側の費用が発生します。

費用の考え方はStable Diffusionの料金を整理した記事にまとめています。

Stable Diffusionのローカル実行でつまずく原因と対処

ローカル実行でよく止まる場所は、公式の記載から先回りできます。

つまずきやすい4つ
  • ライセンスに同意していないとファイルが取れない=モデルカードには「連絡先情報の共有に同意する必要がある」と表示され、同意するまで中身にアクセスできません
  • テキストエンコーダーの取り忘れ=公式GitHubの手順では、本体とは別にCLIP-L・OpenCLIP bigG・T5-XXLの3つを落とす必要があります
  • VRAMが足りない=モデルカードにはbitsandbytesを入れて4bit量子化する方法が載っています
  • デバイス指定の間違い=公式の記載どおり、NVIDIA環境は “cuda”、Apple製の端末は “mps” に切り替えます

VRAM不足の対処は、モデルカードに具体的な手順が載っています。

  1. pip install bitsandbytes を実行する
  2. BitsAndBytesConfigload_in_4bit=Truebnb_4bit_quant_type="nf4" を指定する
  3. 量子化した SD3Transformer2DModel をパイプラインに渡す
  4. pipeline.enable_model_cpu_offload() を有効にする

公式はこの手順を「VRAMの使用量を減らして小さなGPUに載せる」方法として案内しています

それでも動かない場合は、まずMediumに落として試すほうが早く進みます。

Stable Diffusionを仕事で使うときのライセンス(3つの入口に共通)

入口がどれであっても、商用利用の条件は同じ考え方です。

Stability AIの公式ライセンスページには、Communityライセンスの条件が書かれています。

年間売上が100万ドル未満の個人・組織は、研究・非商用・商用のいずれでも無料で使えます

公式のFAQには、個人のクリエイターや愛好家が自宅で生成する分にはライセンス料は不要だと明記されています。

ファインチューニングしたモデルを販売する場合も、年間売上100万ドル未満であれば無料だと書かれています。

年間売上が100万ドルを超える組織はEnterpriseライセンスの対象です。

金額を扱う条件ですが、公式は税の扱いを明記していないため、税抜の売上高として読むのが自然です。

Stable Diffusionの結果を変える設定(ローカル実行の場合)

ローカル実行では、プロンプト以外にも触れる値があります。

設定公式に載っている値どこに書かれているか
num_inference_steps28Hugging Faceのモデルカードのサンプル
guidance_scale3.5(量子化の例では4.5)Hugging Faceのモデルカードのサンプル
max_sequence_length512(量子化の例)Hugging Faceのモデルカードのサンプル
–width / –height例:1920 と 1080公式GitHubのREADME
–steps例:100公式GitHubのREADME

公式が例として出している値から動かすと、何が効いたのかを1つずつ確かめられます

公式のモデルカードには、事実や実在の人物・出来事を正確に表現するために訓練されたモデルではない、という注意も書かれています。

生成AIの前提から確認したい方は生成AI初心者向けの記事から読むと迷いません。

Stable Diffusionの使い方についてよくある質問

Stable Diffusionはインストールしないと使えませんか

いいえ。公式はWebで使う入口としてStable Assistantを案内しています。ブラウザだけで始められます。

Stable Diffusionをローカルで動かすには何が要りますか

公式のGitHubの手順では、モデル本体に加えてCLIP-L・OpenCLIP bigG・T5-XXLの3つのテキストエンコーダー、Pythonの仮想環境、requirements.txtの依存関係が必要です。

Stable Diffusionは自宅のパソコンでも動きますか

公式ページはStable Diffusion 3.5 Mediumについて、コンシューマー向けハードウェアで動くと説明しています。まずMediumから試すのが現実的です。

Stable Diffusionを商用で使えますか

公式ライセンスページには、年間売上100万ドル未満の個人・組織は商用利用も含めて無料と書かれています。超える場合はEnterpriseライセンスの対象です。

Stable DiffusionでVRAMが足りないときはどうしますか

公式モデルカードに、bitsandbytesを使った4bit量子化とCPUオフロードの手順が載っています。

Stable Diffusionをアプリに組み込むにはどうしますか

公式モデルカードはAPIエンドポイントとしてStability AI APIを挙げています。窓口はPlatform APIです。

Stable Diffusionの使い方まとめ:どこから始めるか

  • まずWebのStable Assistantで出力の質を見る。ローカル環境の準備が要らない
  • 設定を細かく触りたくなったらローカルへ。diffusersなら pip install から7手順で動く
  • アプリに組み込むならPlatform API。GPUの用意が不要になる
  • モデルはLarge(品質)・Large Turbo(4ステップの速さ)・Medium(コンシューマー向けハードウェア)の3択
  • ローカルで止まる原因は、ライセンス未同意・エンコーダーの取り忘れ・VRAM不足・デバイス指定の4つがほとんど
  • 商用利用は年間売上100万ドルが分かれ目

手順や条件は変更される場合があります。

最新の内容は必ずStability AI公式の画像モデルのページ公式のモデルカードでご確認ください。

この記事の内容は2026年9月8日に公式サイト・公式ドキュメントで確認したものです。料金や仕様は変わりますので、最新の情報は公式ページでご確認ください。

👑 AIを仕事で使いこなす無料ウェブセミナーはこちら

AIを仕事で使いこなす無料ウェブセミナーはこちら

★★★★☆

AIをゼロから仕事で使えるようにする無料のウェブセミナー。申し込みはフォーム1枚で完了します【参加は無料】

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

CAPTCHA


目次