ストーリー

創業から成功に至るまでの道のり。

ElevenLabsは、音声生成を単機能APIで終わらせず、企業の顧客対応とクリエイターの制作工程を同じ研究基盤から支える会社へ進んだ。

2025年末にはARRが3億3000万ドルを超え、2026年2月のSeries Dでは5億ドルを調達し、評価額は110億ドルになった。出典

創業のきっかけ

共同創業者のPiotr DabkowskiはGoogleでmachine learningに携わり、Mati StaniszewskiはPalantirで企業・政府の技術導入を支援していた。

公式プロフィールによれば、2人はポーランドで10代に出会い、2022年にElevenLabsを創業した。出典 出典

We started by building a voice that could sound human - and we did. Today we are building foundational models across the full audio stack」とPiotr Dabkowskiは語る

転機と苦労

最初の焦点は、人間らしいtext to speechモデルだった。

そこからspeech to text、voice cloning、dubbing、music、conversationへ研究対象を広げた。

ただし声を複製できることは、そのまま信頼を意味しない。

ElevenLabsはcelebrityや高リスク音声のcloningを制限し、Professional Voice Cloningには技術的な検証を求めるなど、生成能力と悪用対策を同時に製品へ組み込んでいる。出典

成長と成功

転機はモデルの性能をAPIだけに閉じず、ElevenAgentsとElevenCreativeという利用文脈に束ねたことだ。

Agentsはtesting、monitoring、integrationsを備えたvoice/chat agent、Creativeは音声・音楽・dubbingなどを制作するplatformとして企業導入を受ける。

公式発表では、APIはMetaやSalesforceなどが使い、1 billion超のユーザーに届く製品を支えている。出典

現在

ElevenLabsは音声モデルの会社から、音声を入口にしたinteraction layerへ変わろうとしている。

創業者の発言どおり、モデルとproduct experienceの接続が次の競争軸になる。

研究、API、agent、creator marketplaceを一つのcredit経済圏に置くことで、単発の音声生成より長い利用を作ろうとしている。出典

独自分析

PMF (プロダクトマーケットフィット)

音声を使う開発者・企業・クリエイターが抱える課題は、自然な声の生成、言語展開、制作運用を別々のツールでつなぐことだった。

ElevenLabsはTTS、STT、cloning、dubbing、agentを同じAPIとcredit体系にまとめる。出典

その結果、音声品質を試す段階から本番の顧客対応まで移行しやすい。

参入障壁 (Moat)

参入障壁は、音声研究のモデル品質、API・SDK・editor・agentを一体で改善できる運用面、そしてcreatorが供給するvoice catalogの組み合わせにある。出典

ただし基盤モデル競争が激しいため、単独の品質差だけでは長期 moat になりにくい。

ネットワーク効果

ネットワーク効果は中程度。

利用企業が増えるほどvoiceの需要とcreator収益が増え、libraryの発見性も上がる。出典

一方、TTS API自体は代替可能で、二面市場の信頼と安全運用が崩れると効果も弱まる。

ターゲット

主な対象は、音声UIやvoice agentを組み込む開発者、動画・podcast・audiobookを多言語化するクリエイター、顧客対応を自動化したい企業である。出典

音声を使わない単純な業務SaaSには過剰な基盤になりやすい。

成功要因

第一に、研究成果を低遅延APIとno-code editorの両方へ落とした。

第二に、voice libraryとcreator marketplaceで供給側も増やした。

2026年時点でvoice creatorsへの累計支払は2200万ドル超、収益化するcreatorは1万400人超と公式発表されている。出典

失敗・課題

音声cloningは品質だけでなく、なりすまし・同意・著作権のリスクを伴う。

公式Safety方針も、検知や制限が完全ではないことを認めている。出典

また、複数モデル・複数製品を一つのcreditで売る設計は分かりやすい反面、用途別の原価と価格の理解を難しくする。

グロース戦略

初期は開発者向けAPIと高品質なvoice体験で採用を作り、現在はAgents・Creative・Enterpriseへ拡張している。

公式発表では2025年末ARRは3億3000万ドル超、2026年Series Dで5億ドルを調達した。出典

PLGの入口を保ちながら、企業のdeployment・support・securityを追加する二層構造が成長の軸だ。

主要チャネル: developer_api, creator_marketplace, enterprise_sales, partnerships, content_marketing

学べること

単一モデルの性能を売るだけでなく、API、editor、marketplace、agentのように利用文脈へ段階的に展開すると、技術の進歩を複数の収益導線へ変えられる。

ElevenLabsの例は、研究優位をworkflowと運用信頼へ翻訳する重要性を示す。

日本で展開するなら

日本ではaudiobook、ゲーム、アニメ、教育、観光の多言語化が入口になる。

導入時は声の権利・本人同意・生成物の表示を契約とUIの両方で明確にし、品質だけでなくtraceabilityを評価軸に置くべきだ。

主な競合

  • OpenAI
  • Google Cloud Text-to-Speech
  • Amazon Polly
  • Play.ht

Timeline

創業から成功に至る道のり。転機ごとの収益・調達・バリュエーション (出典あり) も併記します。

  1. ローンチ出典

  2. Piotr DabkowskiとMati StaniszewskiがElevenLabsを創業し、人間らしいAI text to speechを開発開始。出典

  3. 初期のText to Speech modelがbeta提供され、audiobook制作などへ利用が広がる。出典

  4. Series Cで1億8000万ドルを調達。出典

    • 調達 $180,000,000
    • Series C
  5. 2025年をARR3億3000万ドル超で終える。出典

    • ARR $330,000,000
  6. Series Dで5億ドルを調達し、評価額110億ドル、累計調達7億8100万ドルとなる。出典

    • 調達 $500,000,000
    • バリュエーション $11,000,000,000
    • Series D
  7. Voice creatorsへの累計支払が2200万ドル超、収益化するcreatorが1万400人超となる。出典

    • ユーザー 10,400

ポジショニング

分析で挙げた競合プロダクトとの相対位置を示しています。

usage-based APIからenterprise agentとcreator platformまで広い提供範囲を持つ

参考リンク

関連プロダクト