ElevenLabsの使い方は、公式ドキュメントを読むかぎり「テキストを入力する」「声を選ぶ」「生成ボタンを押す」の3手です。
設定をいじらなくても音声は出ますので、最初は難しく考えなくて大丈夫です。
日本語については、Eleven Multilingual v2 が対応する29言語のなかに日本語が明記されていました。
商用利用については、公式ドキュメントに「生成した音声の所有権は利用者にあるが、商用利用の権利は有料プランでのみ利用できる」という趣旨の記載があります。
料金は公式の料金ページに米ドル建てで掲載されており、無料プランは0ドル、いちばん安い有料プランのStarterが月6ドルと表示されていました。
この記事は、2026年9月4日にElevenLabsの公式ドキュメントと公式料金ページを確認した時点の記載にもとづいてまとめたものです。
ElevenLabsの使い方は「文章を貼る・声を選ぶ・生成する」の3手です
まず、いちばん知りたい部分からお答えします。
ElevenLabs公式の製品ガイド「Text to Speech の製品ガイド(ElevenLabs公式ドキュメント)」には、音声を作る手順が4つのステップに分けて書かれていました。
そのうち3つ目は「必要なら設定を変える(optional)」と明記されていますので、実質的に必須の操作は3つだけという整理になります。
- Text input…Text to Speech のページの入力欄に、読ませたい文章を入力するか貼り付ける
- Voice selection…画面左下の Voices から使いたい声を選ぶ
- Adjust settings(任意)…出したい音になるよう声の設定を変える
- Generate…Generate ボタンを押して音声ファイルを作る
この4行が、ElevenLabsの操作のほぼすべてです。
難しいのは操作ではなく、次に説明する「どの声を選ぶか」「どのモデルを選ぶか」のほうだと公式ガイドも書いています。
ElevenLabsの始め方|アカウント作成から最初の1音声まで
ElevenLabsは、ブラウザで使うウェブアプリと、開発者向けのAPIの2つの入口があります。
はじめて触る方は、ブラウザ版から入るのがおすすめです。
公式サイトの右上に「Sign up」の導線があり、そこからアカウントを作る流れになっています。
- 公式サイトでアカウントを作成する(無料プランのまま進められます)
- ログイン後、Text to Speech の画面を開く
- 入力欄に日本語の文章を貼り付ける
- 声の一覧から、日本語を学習した声を選ぶ
- Generate を押して、生成された音声を再生・ダウンロードする
ここまでで、最初の1音声はできあがります。
公式ドキュメントの「Overview(ElevenLabs公式ドキュメント)」を読むと、ElevenLabsは音声合成だけの会社ではないことが分かります。
ElevenCreative(制作用の画面)、ElevenAgents(音声エージェント)、ElevenAPI(開発者向けのAPI)、Reception AI(電話受付)という4つの入口が並べて説明されていました。
この記事で扱うのは、そのうちElevenCreative の Text to Speech、つまり文章を音声に変える部分です。
開発者としてAPIから使う場合の最初の1回
プログラムから呼び出したい方向けの手順も、公式ドキュメントに明記されています。
「ElevenAPI quickstart(ElevenLabs公式ドキュメント)」には、次の3ステップが書かれていました。
- ダッシュボードでAPIキーを作成し、環境変数などの安全な場所に保管する
- SDKをインストールする(Pythonなら
pip install elevenlabs) text_to_speech.convert()に text・voice_id・model_id・output_format を渡して実行する
公式のサンプルコードでは、model_id に eleven_v3、output_format に mp3_44100_128が指定されていました。
スピーカーから再生するために、環境によってはMPVやffmpegの導入を求められることがある、という注意書きも添えられています。
APIの詳細な仕様は「API reference(ElevenLabs公式ドキュメント)」にまとまっています。
ElevenLabsの画面と基本操作|声・モデル・設定の順に決めます
公式の製品ガイドには、出来上がりに効く要素の優先順位がはっきり書かれていました。
「声の選択がもっとも重要で、次にモデルの選択、そのあとにモデルの設定」という順番です。
つまり、細かいスライダーをいじる前に、まず声を選び直したほうが効果が大きいということになります。
| 決める順番 | 公式ガイドに書かれていた内容 |
|---|---|
| 1. Voice(声) | 性別・トーン・アクセント・話す速さ・言い回しが決まる。もっとも影響が大きい |
| 2. Model(モデル) | 声の次に影響が大きい。声との相性があるので組み合わせを試すことが推奨されている |
| 3. Voice settings(設定) | よく使われるのは stability 約50、similarity 約75、style は0のまま |
設定の数値については、公式ガイドが「stability 50前後、similarity 75前後、styleは0、そこから大きくは動かさない」という目安を挙げていました。
もちろん、元の声と狙っている演技によって最適値は変わる、という但し書きも同時に書かれています。
最初はこの数値のまま使って、気になったところだけ動かすのが安全です。
声を選ぶときにいちばん大事な原則
公式ガイドには、日本語で使う人にとって決定的な一文がありました。
「どの声も技術的にはどの言語も話せるが、元のアクセントは残る」という説明です。
例として、英語ネイティブの声でフランス語を生成すると、フランス語ではあるが英語なまりになる、と書かれていました。
これは日本語でも同じことが起きます。
- 日本語の文章を読ませたいなら、日本語で学習された声を Voice Library から選ぶ
- またはその言語を話している音声から自分でクローンを作る
- 英語の声に日本語を読ませると、日本語ではあるが外国語なまりになりやすい
ここを外すと、モデルや設定をどれだけ調整しても不自然さが残ります。
ElevenLabsで日本語の音声を作る方法|対応モデルを公式で確認しました
日本語が使えるかどうかは、モデルの対応言語で決まります。
公式ドキュメントの「Models(ElevenLabs公式ドキュメント)」には、モデルごとの対応言語が一覧で載っていました。
Eleven Multilingual v2 の対応言語のなかに ja(日本語)が明記されています。
また、Eleven v3 の対応言語一覧にも Japanese(jpn)が含まれていました。
| モデル | 公式ドキュメントに書かれていた特徴 | 日本語 |
|---|---|---|
| Eleven v3 | もっとも表現力が高いモデル。70以上の言語に対応、1回あたり5,000文字まで、複数話者の会話にも対応 | 対応(jpn の記載あり) |
| Eleven v3 Conversational | リアルタイム向けの表現力重視モデル。低遅延(約280ms)、音声タグでの制御に対応 | 70以上の言語に含まれる |
| Eleven Multilingual v2 | 自然さと安定性のバランス型。29言語、1回あたり10,000文字まで、長文でもっとも安定 | 対応(ja の記載あり) |
| Eleven Flash v2.5 | 速度重視。32言語、1回あたり40,000文字まで、遅延およそ75ms、API生成の文字単価が50%安い | v2の言語に含まれる |
長い原稿を一気に読ませたいときは、文字数上限が10,000文字で「長文でもっとも安定している」と書かれた Multilingual v2が候補になります。
逆に、会話アプリなどで待ち時間を減らしたいときは Flash v2.5 が向いている、という整理です。
読み方や間(ま)を整えたいとき
公式のベストプラクティスには、細かい制御の方法も書かれていました。
間を入れたいときは <break time="1.5s" /> のようなタグで最大3秒までの休止を入れられる、という説明です。
ただし1回の生成でタグを使いすぎると不安定になり、速くなったりノイズが混ざったりすることがある、という注意も併記されています。
なお、Eleven v3 は SSML の break タグに対応していないと明記されていました。
読み方そのものを指定したい場合、v3では発音記号(IPA)をスラッシュで囲んで本文に直接書けます。
公式は、この方法の一致率を80〜90%程度と説明しており、100%ではないと正直に書いています。
公式ドキュメントには、「感情を表す説明文はそのまま読み上げられてしまうので、不要なら手で取り除く必要がある」と書かれています。
「彼女は嬉しそうに言った」といった地の文を残したままにすると、その文章ごと音声になります。
台本を貼り付ける前に、ト書きを消しておくのが確実です。
ElevenLabsでできること一覧|読み上げ以外の機能もそろっています
ElevenLabsは音声の読み上げだけの道具ではありません。
公式ドキュメントのトップに、機能が一覧で並べられていました。
- Text to Speech…文章を音声にする(この記事の中心)
- Speech to Text…音声を文字起こしする
- Music…テキストから音楽を生成する
- Text to Dialogue…複数話者の会話音声を作る
- Voice changer…話した声を別の声に変換する
- Voice isolator…背景ノイズから声だけを取り出す
- Dubbing…動画や音声を別の言語に吹き替える
- Sound effects…効果音を生成する
- Voices…声を複製したり、説明文から新しい声を設計したりする
このうち、日本語で使う人がいちばん気になるのはDubbing(吹き替え)だと思います。
公式の製品ガイド「Dubbing の製品ガイド(ElevenLabs公式ドキュメント)」には、吹き替えは無料プランを含むすべてのプランで使えると書かれていました。
ただし、無料プランで作った吹き替えには自動で透かし(ウォーターマーク)が入り、それを外す選択肢は無いとも明記されています。
有料プランでは透かしが入らない、という書き方でした。
ウェブから v2 モデルで吹き替える場合、アップロードできるファイルは2GBかつ180分までという上限も記載されています。
料金は「元の素材の1分あたり × 吹き替える言語の数」で課金され、開始前に総額が画面に表示される、という説明でした。
ElevenLabsの料金プラン|公式の料金ページに載っていた金額
料金はElevenLabs公式の料金ページに、米ドル建てで掲載されていました。
2026年9月4日時点で、ElevenCreative(制作用)のタブに表示されていた内容を表にします。
| プラン | 月額(米ドル) | 料金ページに書かれていた主な内容 |
|---|---|---|
| Free | $0 | Text to Speech、Speech to Text、効果音、Voice Design、Music、Productions、Image。Studioのプロジェクトは3つ。月10,000クレジット |
| Starter | $6 | Freeの内容に加えて商用ライセンス、Instant Voice Cloning、Studioのプロジェクト20、音楽の商用利用、Dubbing Studio、Image & Video。月30,000クレジット |
| Creator | $22(初月50%オフで$11の表示あり) | Starterの内容に加えて Professional Voice Cloning、クレジットの追加購入。月121,000クレジット |
| Pro | $99 | Creatorの内容に加えて API経由の44.1kHz PCM出力、192kbps品質の音声。月600,000クレジット |
| Scale | $299 | Proの内容に加えて ワークスペース3席、チームでの共同作業、Professional Voice Clone 3つ。月1,800,000クレジット |
| Business | $990 | Scaleの内容に加えて 低遅延TTSが1分5セントから、Professional Voice Clone 10、ワークスペース10席。月6,000,000クレジット |
| Enterprise | 個別見積り | DPA/SLAの個別条件、HIPAA対応のBAA、カスタムSSO、同時実行数の引き上げなど |
料金ページには「価格はすべての税・賦課金・関税を含みません」という注記が添えられていました。
日本から契約する場合、この金額に消費税や為替の影響が乗る点にご注意ください。
表の右端にある「クレジット」が、ElevenLabsの使用量の単位です。
クレジットの数え方は「1文字=1クレジット」
公式ドキュメントの Overview に、クレジットの定義がはっきり書かれていました。
Text to Speech は、入力したテキストの1文字あたり1クレジットを消費するという説明です。
それ以外の処理は、扱った音声の秒数に応じて課金される、と書かれています。
さらに、クレジットは毎月リセットされ、使い切らなかった分は最大2か月まで繰り越せるとも明記されていました。
たとえばStarterの月30,000クレジットは、単純計算で日本語30,000文字ぶんの読み上げにあたります。
原稿用紙にすると75枚ぶんですので、個人が試す用途なら十分な量です。
ElevenLabsの商用利用の条件|有料プランが必要だと公式が明記しています
ここが、この記事でいちばんお伝えしたい部分です。
公式ドキュメントの「Text to Speech(ElevenLabs公式ドキュメント)」のFAQに、権利についての質問と回答が載っていました。
Q. 生成した音声は自分のものになりますか?
A. はい。生成した音声の所有権は利用者が保持します。ただし、商用利用の権利は有料プランでのみ利用できます。
有料プランに加入していれば、入力した内容の知的財産権を自分が持っているかぎり、生成した音声を商用目的で使い、収益化できる、という趣旨の説明が続いていました。
つまり、条件は2つあるという整理になります。
- 有料プランに入っていること…料金ページでも Commercial License は Starter 以上に記載されていました
- 入力した内容の権利を自分が持っていること…他人の文章をそのまま読み上げさせた場合は、その文章側の権利が別に問題になります
無料プランのまま作った音声をYouTubeの収益化動画や広告に使う、という運用は公式の記載と食い違いますので避けてください。
料金ページを見るかぎり、商用ライセンスが付く最安のプランは月6ドルのStarterでした。
仕事で使う可能性が少しでもあるなら、ここは最初から有料にしておくのが結果的に安全です。
なお、規約の細かい条件は改定されることがありますので、契約前にElevenLabs公式の料金ページの記載をご自身でも確認してください。
ElevenLabsで自分の声を複製する方法(ボイスクローン)
ElevenLabsには、声を複製する機能が2種類あります。
公式ドキュメントでは Instant Voice Cloning と Professional Voice Cloning として説明されていました。
| Instant Voice Cloning | Professional Voice Cloning | |
|---|---|---|
| 必要な音声の長さ | 1〜2分程度の良質な音声 | 30〜180分の良質な音声 |
| できあがるまで | その場で使える | 学習に通常3〜6時間(待ち行列の状況による) |
| 公式の位置づけ | 2分未満の音声で手早く複製できる | 専用モデルを学習させ、元の声とほぼ区別できない品質を目指す |
| 対応プラン | 料金ページでは Starter 以上に記載 | 料金ページでは Creator 以上に記載 |
Instant Voice Cloning の手順は「Instant Voice Cloning(ElevenLabs公式ドキュメント)」に4ステップで書かれていました。
- 左のメニューから Voices を選び、プラスのアイコンをクリックする
- 表示された画面で Instant Voice Clone を選ぶ
- 案内に従って音声をアップロードするか、その場で録音する
- 名前とラベルを付け、その声を複製する権利と同意があることを確認したうえで Save voice を押す
4番目の「権利と同意の確認」は、公式の手順そのものに組み込まれている項目です。
他人の声を勝手に複製する用途は想定されていない、と読むのが自然です。
公式が挙げていた録音のコツ
クローンの品質は、録音の質でほぼ決まると公式ドキュメントは書いています。
- 最低1分は録る。ただし3分を超えて録っても改善は小さく、かえって悪化することがある
- サンプルの本数は関係なく、合計の長さが重要
- 残響・ノイズ・口のクリック音が入らない環境で録る
- 話す速さ・抑揚・声色を最後まで一定に保つ(AIは聞こえたものをすべて真似ようとする)
- 音量の目安は RMS で −23dB〜−18dB、トゥルーピークは −3dB
- ファイル形式は MP3 の192kbps以上を推奨。WAVなどの非圧縮は品質改善につながらず、アップロードで問題が出ることがある
「速く感情を込めて話せば、AIもそのように話す」という説明が印象的でした。
落ち着いたナレーション用の声がほしいなら、録音時点で落ち着いて読む必要がある、ということです。
より高品質を狙う場合の条件は「Professional Voice Cloning(ElevenLabs公式ドキュメント)」にまとまっています。
ElevenLabsの声の探し方|Voice Libraryの使い方
自分の声を使わない場合は、共有されている声から選ぶことになります。
公式ドキュメントによると、ElevenLabsは10,000以上の声のライブラリを持っており、Voice Library には3,000以上のコミュニティ共有の声があるとされています。
「Voice Library(ElevenLabs公式ドキュメント)」には、絞り込みの条件が細かく書かれていました。
| フィルター | 公式ドキュメントに書かれていた内容 |
|---|---|
| Language | その言語で学習された声を返す。どの声でもどの言語は使えるが、タグの付いた言語でいちばん良く動く |
| Accent | 言語を選ぶとアクセントの絞り込みが使えるようになる |
| Category | Conversational/Narration/Characters/Social Media/Educational/Advertisement/Entertainment |
| Gender・Age | 男性・女性・中性/若い・中年・高齢 |
| Notice period | 提供者が公開をやめたときに使い続けられる猶予期間。最長2年 |
| Quality | Studio Quality は、適切な機材で録音され、反響や歪みが無いことをQAが確認した声 |
見落とされがちなのが Notice period(猶予期間)です。
公式ドキュメントには、猶予期間の無い声は、提供者が公開をやめた瞬間に使えなくなると書かれていました。
シリーズもののナレーションなど、同じ声を長く使い続けたい用途では、この列を必ず確認してください。
なお、Voice Library は無料プランのユーザーにはAPI経由で提供されないという注記もありました。
ElevenLabsを使うときの注意点|生成し直しと「毎回同じにならない」性質
公式ドキュメントには、知らないと戸惑う仕様が2つ書かれていました。
1つ目は、出力が毎回まったく同じにはならない(nondeterministic)という性質です。
同じ文章・同じ設定でも、生成のたびに微妙に違う音になります。
そろえたい場合は seed というパラメータを使えるが、それでも細かい差は残ることがある、と説明されていました。
2つ目は、無料でやり直せる回数です。
- 同じ内容について、最大2回まで無料で生成し直せる
- 文章・声の設定・その他のパラメータを1つでも変えると、新しい有料の生成として数えられる
- 公式の社内ベンチマークでは、生成し直すことで品質の問題のおよそ半分は解消するとされている
- 残る問題は、たいてい学習に使った音声そのものの質が原因と説明されている
つまり、少し気に入らないからといって文言を変えて出し直すと、そのたびにクレジットが減ります。
台本は先に確定させてから生成に入るのが、いちばん節約になります。
長い原稿については、分割してから流し、前後の文脈を渡すパラメータでつなぎ目を自然にする方法が案内されていました。
このあたりの考え方は、文章生成のAIを扱うときと共通しています(→Claudeの使い方)。
ElevenLabsが向いている人・向いていない人
ここまで公式の記載を並べてきましたので、向き不向きを整理します。
| 向いている | 向いていない |
|---|---|
| ナレーション音声を自分で用意したい人 | 無料のまま商用利用したい人(公式が有料プランを条件にしています) |
| 自分の声を複製して読み上げに使いたい人 | 他人の声を許可なく使いたい人(同意の確認が手順に入っています) |
| 日本語以外の言語にも展開したい人 | 毎回まったく同じ音声を再現したい人 |
| 長い原稿を安定して読ませたい人 | 短い1本だけで、しかも無料で完結させたい人 |
| アプリやサービスに音声を組み込みたい開発者 | 録音環境を用意できないのに高品質なクローンを求める人 |
右の列は、どれも公式ドキュメントの記載から素直に導かれるものです。
とくに1行目は、後から「知らなかった」では済まない項目です。
仕事で使う予定があるなら、最初から有料プランで始めてください。
なお、生成AIを何から触るか迷っている段階の方は、生成AIの初心者向けガイドから読むと全体像がつかめます。
ElevenLabsのモデルの違い|v3・Multilingual v2・Flash v2.5の選び分け
公式ドキュメントには、モデルごとの得意分野が用途別に書かれていました。
迷ったときの選び分けを、記載内容から整理します。
- 感情表現を優先したい…Eleven v3。公式は「キャラクター同士の会話」「オーディオブック制作」「感情のある対話」を得意な場面として挙げていました
- 長い原稿を安定して読ませたい…Eleven Multilingual v2。1回10,000文字まで、長文でもっとも安定と明記
- 速さと費用を優先したい…Eleven Flash v2.5。遅延およそ75ms、1回40,000文字まで、API生成の文字単価が50%安い
- リアルタイムの会話に使いたい…Eleven v3 Conversational。遅延およそ280msで、音声タグによる制御に対応
なお、英語だけで使うなら英語専用モデルを強く推奨すると公式ガイドは書いています。
日本語を含む場合は、多言語対応のモデルを選ぶ必要があります。
旧世代の eleven_turbo_v2_5 と eleven_turbo_v2 については、Flashモデルのほうが平均して遅延が低いため、すべての用途でFlashを推奨すると明記されていました。
出力形式は既定がMP3で、PCMやμ-lawなども選べます。
ただし高音質の出力は有料プランでのみ利用できるという注記が付いていました。
画像や資料づくりまで含めて制作を回したい方は、CanvaのAI機能の使い方もあわせて読むと作業の全体像がつながります。
ElevenLabsのよくある質問
ElevenLabsは日本語に対応していますか?
対応しています。公式ドキュメントのモデル一覧で、Eleven Multilingual v2 の対応29言語に ja(日本語)が明記されており、Eleven v3 の対応言語一覧にも Japanese(jpn)が含まれていました。なお、日本語の文章を読ませるときは、日本語で学習された声を選ぶことが公式ガイドで推奨されています(2026年9月4日確認)。
ElevenLabsは無料で使えますか?
公式の料金ページには月0ドルのFreeプランが掲載されており、月10,000クレジットが付くと表示されていました。ただし商用ライセンスは有料プランの記載になっていますので、無料プランで作った音声を仕事や収益化に使うことはできません(2026年9月4日確認)。
生成した音声を仕事で使ってもいいですか?
公式ドキュメントのFAQには、生成した音声の所有権は利用者が保持するが、商用利用の権利は有料プランでのみ利用できる、という趣旨の記載があります。あわせて、入力した内容の知的財産権を自分が持っていることが条件として書かれていました(2026年9月4日確認)。
クレジットはどう数えられますか?
公式ドキュメントのOverviewに、Text to Speech は入力テキストの1文字あたり1クレジットを消費すると書かれていました。それ以外の処理は音声の秒数に応じて課金されます。クレジットは毎月リセットされ、使い切らなかった分は最大2か月まで繰り越せると明記されています(2026年9月4日確認)。
自分の声を複製するには何分の音声が必要ですか?
Instant Voice Cloning では1〜2分程度の良質な音声が推奨されており、3分を超えて録っても改善は小さく、場合によっては悪化することがあると書かれていました。Professional Voice Cloning は30〜180分の音声が推奨され、学習には通常3〜6時間かかるとされています(2026年9月4日確認)。
同じ文章なのに、生成するたびに音が違うのはなぜですか?
公式ドキュメントに、モデルの出力は毎回同じにはならない性質(nondeterministic)であると明記されています。そろえたい場合は seed パラメータを使う方法が案内されていますが、それでも細かい差は残ることがある、と書かれていました(2026年9月4日確認)。
吹き替え(Dubbing)は無料プランでも使えますか?
公式の製品ガイドには、Dubbing は無料プランを含むすべてのプランで使えると書かれていました。ただし無料プランで生成した吹き替えには自動で透かしが入り、外す選択肢は無いと明記されています(2026年9月4日確認)。
ElevenLabsの使い方まとめ
最後に、この記事で確認した内容を短くまとめます。
- 操作は「文章を貼る」「声を選ぶ」「Generateを押す」の3手で、設定は任意
- 出来上がりに効く順番は声 → モデル → 設定と公式ガイドに明記
- 日本語は Multilingual v2(29言語のうち ja)と Eleven v3(jpn)で対応
- 日本語の文章には、日本語で学習された声を選ぶ(英語の声は英語なまりが残る)
- クレジットは1文字=1で、毎月リセット・最大2か月まで繰り越し
- 商用利用は有料プランが条件。料金ページでは Starter(月6ドル)から商用ライセンスの記載
- 声の複製は、権利と同意の確認が手順に組み込まれている
いちばん大事なのは、無料プランのまま商用に使わないことです。
ここだけは、あとから取り返しがつきにくい部分になります。
ここまで読んで「AIを仕事の中にどう組み込むかを、もう少し体系立てて学びたい」と感じた方は、自分専属AI育成ウェブセミナーのような、手を動かしながら学ぶ形の講座を一度のぞいてみるのも手です。
この記事の内容は2026年9月4日にElevenLabsの公式ドキュメントで確認したものです。仕様や料金は変わりますので、最新の情報は公式ページでご確認ください。


コメント