
画像生成AIのStable Diffusionを使ってみたいけれど、調べるほど入口が増えて手が止まる。
そう感じている方に向けて、Stability AIの公式サイトと公式のモデルカード、公式リポジトリに書かれている手順だけを整理しました。
Stable Diffusionには入口が3つあり、どれを選ぶかで手順がまったく変わります。
この記事の情報は2026年9月8日時点のものです。
最新の内容は必ずStability AI公式の画像モデルのページでご確認ください。
【結論】Stable Diffusionの使い方は「ローカル・Web・API」の3つに分かれる
結論から書きます。
Stability AIの公式ページは、Stable Diffusion 3.5について ローカル(自分の環境で動かす)・API・Webの3つの入口 を並べて案内しています。
公式ページに置かれている導線は次の3本です。
- ローカルで動かす=ライセンスに同意してモデルの重みを取得する
- APIから呼ぶ=Platform APIを使う
- Webで使う=Stable Assistantから始める
この記事では、どの見出しがどの入口の話なのかを毎回はっきり書き分けます。
自分がどれを使うのかを先に決めてから読み進めてください。
Stable Diffusionの3つの入口を一覧で比較する
公式に書かれている性格の違いを表にしました。
| 入口 | 公式の窓口 | 必要なもの | 向いている人 |
|---|---|---|---|
| ローカル実行 | Hugging Faceのモデルカード / 公式GitHub | GPU環境とPythonの実行環境 | 設定を細かく触りたい人 |
| API | Platform API(platform.stability.ai) | APIキーと開発環境 | 自分のアプリに組み込みたい人 |
| Web | Stable Assistant | ブラウザとアカウント | まず画面で試したい人 |
公式が「まず始めるなら」として挙げているのはStable Assistantです。
画像モデルのページに、Stable Assistantから作り始める導線が置かれています。
Stable Diffusionをローカルで使う手順①:diffusersで動かす
ここからはローカル実行の話です。
Hugging Faceの公式モデルカードに載っているコードをそのままなぞる方法が、いちばん短い経路になります。
- stabilityai/stable-diffusion-3.5-large のモデルカードを開く
- ページ上部の同意欄でライセンスに同意する(同意しないとファイルにアクセスできない)
- ターミナルで
pip install -U diffusers transformers accelerateを実行する - Pythonから
StableDiffusion3Pipeline.from_pretrained("stabilityai/stable-diffusion-3.5-large", torch_dtype=torch.bfloat16)でパイプラインを読み込む pipe.to("cuda")でGPUに載せる(公式の記載どおり、Apple製の端末では “mps” に切り替える)- プロンプトを渡して
num_inference_steps=28、guidance_scale=3.5で生成する - 返ってきた画像を
image.save("出力名.png")で保存する
ステップ数28とガイダンススケール3.5は、公式モデルカードのサンプルに書かれている値です。
まずはこの値のまま回して、出力を見てから動かすのが安全です。
モデルカードには、ローカルや自前ホストで使うならノードベースのUIであるComfyUI、あるいはプログラムから使うならdiffusersかGitHubを推奨する、とも書かれています。
Stable Diffusionをローカルで使う手順②:公式リファレンス実装で動かす
引き続きローカル実行の話です。
Stability AIは、推論だけを行う小さな参照実装を公式のGitHubリポジトリで公開しています。
READMEに書かれている手順は次のとおりです。
- Hugging Faceから
sd3.5_large.safetensors(またはLarge Turbo、Medium)をmodelsディレクトリへ入れる - テキストエンコーダーを3つ別々にダウンロードする=
clip_l.safetensors、clip_g.safetensors、t5xxl_fp16.safetensors python3 -s -m venv .sd3.5で仮想環境を作る(Windowsはpythonと打つ、とREADMEに注記あり)source .sd3.5/bin/activateで仮想環境に入るpython3 -s -m pip install -r requirements.txtで依存関係を入れるpython3 sd3_infer.py --prompt "cute wallpaper art of a cat"で生成する- 出力を確認する(既定の保存先は
outputs/<MODEL>/<PROMPT>_<DATETIME>_<POSTFIX>)
解像度を変えたいときは --width と --height を足します。
ステップ数を変えたいときは --steps を足します。
READMEには、この参照実装はパートナー向けの実装補助が目的であり、別の推論環境が必要ならComfyUIを使うようにと明記されています。
Stable Diffusionのモデルはどれを選ぶか(ローカル実行の場合)
ローカルで動かすときは、最初にモデルを選びます。
公式の画像モデルページには3種類が並んでいます。
| モデル | 公式の説明 | 公式のモデルカード |
|---|---|---|
| Stable Diffusion 3.5 Large | ファミリーで最も強力。品質とプロンプト追従に優れ、1メガピクセルのプロ用途向け | Hugging Faceで公開 |
| Stable Diffusion 3.5 Large Turbo | 4ステップで高品質な画像を生成する高速版 | Hugging Faceで公開 |
| Stable Diffusion 3.5 Medium | 品質とカスタマイズ性のバランス型。コンシューマー向けハードウェアで動く | Hugging Faceで公開 |
自宅のPCで動かすなら、公式が「コンシューマー向けハードウェアで動く」と書いているMediumが出発点になります。
各モデルカードはLarge、Large Turbo、Mediumにあります。
公式のGitHubリポジトリには、Mediumで構造や解剖学的な破綻を減らしたいときに --skip_layer_cfg True を付ける方法も書かれています。
他の画像生成サービスと比べたい方はMidjourneyの使い方の記事も参考になります。
Stable DiffusionをWeb版(Stable Assistant)で使う
ここからはWebの入口の話です。
Stable Assistantは、Stability AIが提供している作成ツールです。
公式ページには、Stable AssistantはStable Image Ultraで動いており、これはStable Diffusion 3.5 Largeに高度なワークフローを組み合わせたものだと記載されています。
つまりWebの入口でも、土台になっているのは同じStable Diffusion 3.5 Largeです。
公式ページに列挙されている編集機能は次のとおりです。
- Search and Replace(探して置き換える)
- Erase(消す)/Inpaint(描き足す)
- Remove Background(背景を消す)
- Zoom Out(外側へ広げる)/Upscale(拡大する)/Enhance(品質を上げる)
- Sketch to Image(下書きから画像へ)
- Search and Recolor(探して色を変える)
- Image to 3D(画像から3Dへ)
手順はStable Assistantのページからログインして始めるだけです。
ローカル環境の構築が不要なので、まず出力の質を確かめたい段階ではここがいちばん速い入口になります。
Stable DiffusionをAPIから使う入口
ここからはAPIの入口の話です。
公式のモデルカードには、利用できるAPIエンドポイントとして Stability AI API が挙げられています。
窓口はPlatform API(platform.stability.ai)です。
自分のアプリやワークフローに画像生成を組み込むなら、ローカルにモデルを置かずAPIで呼ぶ形が公式の想定です。
この入口ではGPUを自分で用意する必要がありません。
そのかわり、生成のたびにAPI側の費用が発生します。
費用の考え方はStable Diffusionの料金を整理した記事にまとめています。
Stable Diffusionのローカル実行でつまずく原因と対処
ローカル実行でよく止まる場所は、公式の記載から先回りできます。
- ライセンスに同意していないとファイルが取れない=モデルカードには「連絡先情報の共有に同意する必要がある」と表示され、同意するまで中身にアクセスできません
- テキストエンコーダーの取り忘れ=公式GitHubの手順では、本体とは別にCLIP-L・OpenCLIP bigG・T5-XXLの3つを落とす必要があります
- VRAMが足りない=モデルカードにはbitsandbytesを入れて4bit量子化する方法が載っています
- デバイス指定の間違い=公式の記載どおり、NVIDIA環境は “cuda”、Apple製の端末は “mps” に切り替えます
VRAM不足の対処は、モデルカードに具体的な手順が載っています。
pip install bitsandbytesを実行するBitsAndBytesConfigでload_in_4bit=True、bnb_4bit_quant_type="nf4"を指定する- 量子化した
SD3Transformer2DModelをパイプラインに渡す pipeline.enable_model_cpu_offload()を有効にする
公式はこの手順を「VRAMの使用量を減らして小さなGPUに載せる」方法として案内しています。
それでも動かない場合は、まずMediumに落として試すほうが早く進みます。
Stable Diffusionを仕事で使うときのライセンス(3つの入口に共通)
入口がどれであっても、商用利用の条件は同じ考え方です。
Stability AIの公式ライセンスページには、Communityライセンスの条件が書かれています。
年間売上が100万ドル未満の個人・組織は、研究・非商用・商用のいずれでも無料で使えます。
公式のFAQには、個人のクリエイターや愛好家が自宅で生成する分にはライセンス料は不要だと明記されています。
ファインチューニングしたモデルを販売する場合も、年間売上100万ドル未満であれば無料だと書かれています。
年間売上が100万ドルを超える組織はEnterpriseライセンスの対象です。
金額を扱う条件ですが、公式は税の扱いを明記していないため、税抜の売上高として読むのが自然です。
Stable Diffusionの結果を変える設定(ローカル実行の場合)
ローカル実行では、プロンプト以外にも触れる値があります。
| 設定 | 公式に載っている値 | どこに書かれているか |
|---|---|---|
| num_inference_steps | 28 | Hugging Faceのモデルカードのサンプル |
| guidance_scale | 3.5(量子化の例では4.5) | Hugging Faceのモデルカードのサンプル |
| max_sequence_length | 512(量子化の例) | Hugging Faceのモデルカードのサンプル |
| –width / –height | 例:1920 と 1080 | 公式GitHubのREADME |
| –steps | 例:100 | 公式GitHubのREADME |
公式が例として出している値から動かすと、何が効いたのかを1つずつ確かめられます。
公式のモデルカードには、事実や実在の人物・出来事を正確に表現するために訓練されたモデルではない、という注意も書かれています。
生成AIの前提から確認したい方は生成AI初心者向けの記事から読むと迷いません。
Stable Diffusionの使い方についてよくある質問
Stable Diffusionはインストールしないと使えませんか
いいえ。公式はWebで使う入口としてStable Assistantを案内しています。ブラウザだけで始められます。
Stable Diffusionをローカルで動かすには何が要りますか
公式のGitHubの手順では、モデル本体に加えてCLIP-L・OpenCLIP bigG・T5-XXLの3つのテキストエンコーダー、Pythonの仮想環境、requirements.txtの依存関係が必要です。
Stable Diffusionは自宅のパソコンでも動きますか
公式ページはStable Diffusion 3.5 Mediumについて、コンシューマー向けハードウェアで動くと説明しています。まずMediumから試すのが現実的です。
Stable Diffusionを商用で使えますか
公式ライセンスページには、年間売上100万ドル未満の個人・組織は商用利用も含めて無料と書かれています。超える場合はEnterpriseライセンスの対象です。
Stable DiffusionでVRAMが足りないときはどうしますか
公式モデルカードに、bitsandbytesを使った4bit量子化とCPUオフロードの手順が載っています。
Stable Diffusionをアプリに組み込むにはどうしますか
公式モデルカードはAPIエンドポイントとしてStability AI APIを挙げています。窓口はPlatform APIです。
Stable Diffusionの使い方まとめ:どこから始めるか
- まずWebのStable Assistantで出力の質を見る。ローカル環境の準備が要らない
- 設定を細かく触りたくなったらローカルへ。diffusersなら pip install から7手順で動く
- アプリに組み込むならPlatform API。GPUの用意が不要になる
- モデルはLarge(品質)・Large Turbo(4ステップの速さ)・Medium(コンシューマー向けハードウェア)の3択
- ローカルで止まる原因は、ライセンス未同意・エンコーダーの取り忘れ・VRAM不足・デバイス指定の4つがほとんど
- 商用利用は年間売上100万ドルが分かれ目
手順や条件は変更される場合があります。
最新の内容は必ずStability AI公式の画像モデルのページと公式のモデルカードでご確認ください。
この記事の内容は2026年9月8日に公式サイト・公式ドキュメントで確認したものです。料金や仕様は変わりますので、最新の情報は公式ページでご確認ください。


コメント