見出し画像

Fish Audioが5200万ドル調達、ElevenLabsの6分の1価格へ:【日本語も可】音声AIの値崩れが始まった今、経営者が決めるべき3つのこと

創業1年、社員22人の会社が、音声AIの価格を6分の1に叩き落としました。 2026年7月29日、Fish Audioがシード資金5,200万ドル(約80億円)の調達と、新モデル「S2.1 Pro」の一般公開を発表しました。5秒の音声から声を複製し、競合Cartesiaの2倍速、ElevenLabsの6分の1のコストを掲げています。さらに「御社の音声AIコストを50%削減できなければ、Fish Audioを1年間無料で提供する」という異例の保証まで打ち出しました。本記事は、公式発表と一次情報からこの動きの中身を整理し、B2B企業の経営者が「音声をどう業務に組み込むか」「コスト前提をどう引き直すか」を判断できる状態まで落とし込みます。

営業リスト200万件分無料。

Fish Audioのサービス は こちら 
有料版と同じモデルが8/31まで無料で使えます。


いま何が起きたのか:3行サマリー

結論から言えば、AIの値崩れがテキストから音声へ波及した、というのが今回の発表の本質です。

  1. 創業1年で5,200万ドル調達・ARR 21億円規模:Coreline VenturesとCapital Todayがリード。1年で従業員3名→22名、年間経常収益(ARR)0→2,100万ドル、利用者800万人超、コミュニティに音声モデル200万件が蓄積されました(Fish Audio公式ブログ、2026年7月27日)

  2. 価格が競合の6分の1:新モデルS2.1 Proは「5秒の音声から声を複製」「Cartesiaの2倍速」「ElevenLabsの6分の1のコスト」を掲げ、盲検リスニングテストで66%の聴取者が主要競合より好んだと発表

  3. 8月末までAPI無料:開発者向けにS2.1 Proを8月末まで無料開放。他社からの移行なら3カ月無料、クリエイタープランは50%オフ

先週のClaude Opus 5が半額で登場した記事で「知能の単価が数カ月で半減する」構造を書きましたが、同じことが音声で起きています。


Fish Audioとは何か:VTuberの棒読みに我慢できなかった元NVIDIA研究者

Fish Audioとは、2025年に創業した音声AI企業で、テキスト読み上げ(TTS)と音声認識のモデルを開発・提供するスタートアップである。 創業の経緯が、この会社の設計思想をよく表しています。

チーフサイエンティストのShijia Liao氏は、NVIDIAで動画分野の研究エンジニアとして働きながら、余暇にVTuberの配信を見ていました。そこで気になったのが**「声に生気がない」**こと。自宅の寝室でGPU 1枚(RTX 4090)を使ってモデルの学習を始め、当時業界が追いついていなかった「デュアル自己回帰アーキテクチャ」に賭けたのが、現在のS2系モデルの原型になりました(公式ブログ)。

もう一人の創業者はAmazon AlexaとMetaで音声AIに携わった経験を持ち、そこで従来型TTSの限界を掴んだと述べています。公式ブログの一文が本質を突いています。

「読むために作られた声は、演じることを学ばない」

同社の問題設定はこうです。テキスト読み上げは10年前から「1文だけなら」十分な品質だった。しかし10文目でボロが出る。なぜなら**「言葉を正しくすること」と「言い方を正しくすること」は別の問題**であり、業界のほぼ全員が前者しか解いてこなかったからです。

この視点は、実務で音声を使ったことがある人ほど腑に落ちるはずです。サンプル音声は完璧なのに、実際に5分の解説動画を作らせると単調で聞いていられない。この「5秒はできるが5分が続かない」問題こそが、音声AIが業務で使われてこなかった本当の理由でした。公式サイトのコピーが端的です。「5秒は簡単だ。5分こそが試練だ」

もうひとつ特筆すべきは、この会社がオープンソースのコミュニティから生まれたことです。前身の「Fish Speech」は、ゲーム開発者、アニメファン、キャラクターの吹き替えを趣味でやる人たちに使われることで育ちました。コミュニティには200万件超の音声モデルが蓄積されています。企業向けに設計されたプロダクトが後から一般に降りてくるのではなく、逆方向に育った珍しい経緯です。


S2.1 Proの実力:何ができるモデルなのか

S2.1 Proとは、単語単位で感情・抑揚・話す速さを制御できる、リアルタイム動作の音声生成モデルである。 公式発表から仕様を整理します。

S2.1 Proは5秒の音声から声を複製し、83言語で単語単位の感情制御に対応する

項目 内容 音声の複製 5秒の音声サンプルから声を複製 表現制御 感情・イントネーション・ペースを単語レベルで制御。15,000以上の自然言語による指示に対応 対応言語 83言語以上。各言語のネイティブな抑揚に対応 速度 Cartesiaの2倍速。H200 1枚で毎秒8,000トークン超 コスト ElevenLabsの約6分の1 品質評価 盲検リスニングテストで66%の聴取者が主要競合より好んだ

日本企業にとって見逃せないのが言語対応の質です。同社は「実際のユーザーの選好データで事後学習しているため、訛りのある英語、中国語、日本語、韓国語、スペイン語で強い。標準的なアメリカ英語中心に学習したモデルは、これらの言語で崩れる」と明言しています。

実際、日本のユーザーからも「日本語の自然さがかなり高い。抑揚と間の取り方が、読み上げっぽくない」「これまでElevenLabsを使っていたが、S2.1 Proはクオリティとコストの両面で優れていると感じた」という評価が出ています。英語圏発のAIサービスで日本語が後回しにされがちな中、ここは例外的と言えます。

導入実績も揃っています。HeyGen、LiveKit、Retell、Sanas、OpenArtといったAI企業が本番環境で同社のモデルを使用。開発者と法人が売上の3分の2を占めるまでになりました。


なぜ価格が6分の1になったのか:値下げではなく構造の話

価格差の理由とは、営業戦略としての値下げではなく、推論基盤の作り直しによる原価低減である。 ここを取り違えると判断を誤ります。

公式ブログはこう説明しています。研究チームが1年かけて推論スタック全体を再構築し、独自のFP8カーネルを実装。H200 1枚で毎秒8,000トークン超を達成した結果、1リクエストあたりの原価が「モデルを無料で配っても成立する」水準まで下がったというのです。

つまりこれは、資金力に任せた出血覚悟のダンピングではなく、原価が本当に下がったことによる価格です。だとすれば、この価格は一時的なキャンペーンではなく新しい相場になります。競合も追随せざるを得ません。

「コストを50%削減できなければ1年間無料」という保証も、この文脈で読むと理解できます。原価に自信があるからこそ出せる条件です。

経営の言葉に翻訳すると、こうなります。 AI関連の値下げには2種類あり、資金調達で得た体力を使った出血型と、原価低減による構造型があります。前者は資金が尽きれば戻りますが、後者は戻りません。今回は後者に見えるため、「一時的に安いうちに使い倒す」ではなく「この価格が新しい前提だ」として予算を組み直すのが正しい対応になります。

そして同社は、テキスト読み上げを通過点だと明言しています。次に取りに行くのは音声理解モデル(Audio LM)と音声対音声(speech-to-speech)、つまり「聞いて、理解して、話し返す」層です。ここが実現すると、電話応対や商談の同時通訳といった、より業務中枢に近い領域が射程に入ります。今回の調達は、その開発資金という位置づけです。


B2B企業にとっての意味:音声が「高価な演出」から「標準部品」へ

日本のB2B企業にとっての本質的な変化とは、音声を使うかどうかの判断基準が「効果があるか」から「なぜ使わないのか」に反転することである。

これまで音声AIの導入をためらう最大の理由はコストでした。1文字あたりの単価が高く、大量生成を前提にすると予算が膨らむ。だから「動画のナレーションだけ」「特別なコンテンツだけ」と限定的な使い方に留まっていた企業が多いはずです。

その制約が6分の1になると、判断が変わります。

  • 営業:提案資料の音声解説、商談後のフォロー動画、製品デモのナレーション。これまで外注か手作業だった領域

  • カスタマーサポート:FAQの音声化、自動応答の品質向上。棒読みではないから離脱されにくい

  • 社内教育:マニュアル・研修コンテンツの音声化。多言語展開も83言語対応で現実的に

  • マーケティング:記事コンテンツの音声版、ポッドキャスト化、広告ナレーションの量産とABテスト

特に効くのが**「量」が必要な用途**です。単価が6分の1になると、これまで1本しか作れなかった予算で6本作れる。ナレーションのABテストのように、量が質を作る領域で効果が出ます。

なお、この記事で扱っているのは「AIに実務を任せる」流れの一部です。ChatGPT Voiceのデスクトップ対応で書いた「AIエージェントを声で指揮する」話が入力側の変化だとすれば、今回は出力側の変化にあたります。人がAIに話しかける入口と、AIが人に話しかける出口が、同時に安くなっているのが2026年の状況です。

業種別に見る「最初に効く場所」

  • SaaS・IT(優先度:高):製品デモ・オンボーディング動画の多言語化。83言語対応で海外展開のコストが変わる

  • 人材・教育(優先度:高):研修コンテンツの音声化は量が命。単価低下の恩恵が最も直接的

  • 製造(優先度:中〜高):作業手順書の音声化、多言語対応(外国人材向け)。現場で手が塞がる業務と相性が良い

  • 士業・コンサル(優先度:中):セミナー・解説コンテンツの量産。専門家の時間を使わずに情報発信の量を増やせる

ケーススタディ①:SaaS企業A社の多言語オンボーディング(仮想例)

従業員90名のA社は、製品オンボーディング動画を日本語版のみで運用していました。英語版・韓国語版の要望は営業から上がっていたものの、ナレーション外注が1言語あたり30万円かかるため保留が続いていた案件です。単価が下がったことで試算をやり直したところ、同じ予算で3言語×複数バージョンが現実圏に入りました。無料期間中に英語版を1本作って海外顧客に見せたところ「読み上げっぽくない」と反応が良く、正式に多言語展開の予算が付きました。A社の学びは、保留案件のリストを持っていた会社ほど、単価下落の恩恵をすぐ受け取れるということです。

ケーススタディ②:製造業B社の作業手順の音声化(仮想例)

従業員250名のB社の現場では、外国人材が増える一方で、作業手順書は日本語のテキストのみでした。読めない・読む時間がないという理由で、結局は口頭伝達に頼っていたのが実態です。B社は主要な手順書20本を音声化し、多言語版をQRコードで現場に貼りました。手が塞がる作業中でも聞けることが決め手で、口頭説明の反復が減りました。ここでのポイントは翻訳精度そのものより、「読む」から「聞く」への切り替えが現場の制約に合っていたことです。

最初の30日の進め方(無料期間を使い切る設計)

8月末までAPIが無料なので、検証費用ゼロで判断材料が揃う期間として使い切るのが得策です。

  • 第1週:棚卸し。「コストを理由に音声化を見送ったコンテンツ」を各部門から3つずつ挙げさせる。同時に現在の音声関連費用(外注・ツール・人件費)を集計する

  • 第2〜3週:実物で検証。挙がった候補から2〜3本を実際に生成し、社内と顧客数名に聞かせて反応を取る。日本語の自然さ、固有名詞の読み、専門用語の発音を重点的に確認する

  • 第4週:判定と予算組み替え。品質が実用水準なら、浮く費用と増やせる量を試算し、来期予算に反映する。同時に声の同意書のひな形と、ボイスフィッシング対策のルールを文書化する


見落とされるリスク:声は「本人性」を持つデータである

この技術の最大の経営リスクとは、品質やコストではなく、「5秒で複製できる声」が持つなりすましと権利の問題である。

5秒で声が複製できる以上、「声だけで承認・送金しない」運用ルールは導入の有無に関わらず必要になる

第一に、声の権利と同意です。5秒のサンプルで複製できるということは、社員や取引先の声も同じ手軽さで複製できるということです。ナレーターの声を使う場合はもちろん、社内の誰かの声を使う場合も、用途・期間・二次利用の範囲を明示した書面の同意が必要です。「社内利用だから」で済ませると、退職後の利用可否で揉めます。

第二に、なりすましリスクです。経営者の声を複製した詐欺(ボイスフィッシング)は既に海外で発生しています。自社の経営者・経理担当の声が公開されている(ウェビナー、YouTube、取材動画など)企業ほど狙われやすい。「電話の声だけで送金指示を確定しない」という運用ルールを、技術導入とは無関係に今すぐ整備すべきです。

第三に、データの取扱いです。Fish Audioはオンプレミス展開、データ保持ゼロのポリシー、HIPAA準拠構成に対応していると公表していますが、利用形態によって条件は異なります。顧客の声を扱う場合(コールセンター等)は、契約条件の確認が前提です。

第四に、表示義務です。AI生成音声であることの明示は、業界によって求められ方が変わります。広告・医療・金融など規制の強い領域では、事前に法務と整理してください。


経営者として確認しておくべき5つの観点

確認すべきこととは、ツールの導入可否ではなく、「音声が安くなった前提」で自社の情報発信と業務設計を引き直す作業である。

  • 法務:声の利用に関する同意書のひな形整備(用途・期間・二次利用・退職後の扱い)。AI生成音声の表示ルール。顧客音声を扱う場合のデータ保持条件の確認

  • 財務:既存の音声・ナレーション関連費用(外注費、ナレーター費用、他社ツールのサブスク)を棚卸しし、新しい単価で再計算する。8月末までAPI無料の期間は検証費用ゼロで試せる

  • 組織:誰が音声コンテンツを作るのか。これまで外注していた場合、内製に切り替えると担当が必要になる。「浮いた予算をどこに再投資するか」も同時に決める

  • リスクボイスフィッシング対策の運用ルール(電話の声だけで承認・送金しない)を、導入有無に関わらず整備する。これは全社の話であり、音声AI導入企業だけの問題ではない

  • 戦略:単価が6分の1になったとき、量を6倍にするのか、コストを6分の1にするのか。前者を選ぶなら情報発信の設計から見直す必要があります。これは経営判断であって現場判断ではありません

情報システム・マーケ責任者に今週聞くべき5つの質問

  1. 現在、音声・ナレーション関連に年間いくら使っているか(外注費・ツール費・人件費)?

  2. コストを理由に「音声化を見送った」コンテンツはどれか?

  3. 8月末までの無料期間に、どの用途で検証できるか?

  4. 当社の経営者・経理担当の声は、どの程度ネット上に公開されているか?

  5. 「電話の声だけで承認しない」ルールは明文化されているか?


競合との構図:ElevenLabsはどうなるのか

音声AI市場の現在地とは、品質競争が一巡し、価格と多言語対応が主戦場に移った段階である。

ElevenLabsはこの領域の代名詞的存在で、品質で市場を作った企業です。Fish Audioの発表がここまで話題になったのは、**「品質で並んだうえで価格が6分の1」**という主張だからにほかなりません。X上では「ElevenLabsの創業者は今頃震えているはずだ」という投稿が120万回表示されるなど、反応は過熱気味です。

ただし冷静に見るべき点もあります。

  • ベンチマークの「66%が好んだ」はFish Audio自身による盲検テストの結果であり、独立機関の追試はこれからです

  • ElevenLabs側も対抗策を打つ余地があります。価格改定は最も打ちやすい手です

  • 実運用での安定性、サポート体制、既存ワークフローとの統合しやすさは、ベンチマークに出ません

経営判断としての結論はこうなります。乗り換えを急ぐ必要はないが、いまの単価で契約を固定するのは損。8月末までの無料期間で自社コンテンツを実際に生成し、品質と運用性を確かめてから決めるのが合理的です。

「日本語で崩れない」ことの構造的な意味

もう一段深く見ると、Fish Audioの主張で最も戦略的なのは価格ではなく**「標準的なアメリカ英語中心に学習したモデルは、日本語や訛りのある英語で崩れる」**という指摘です。

これは日本企業にとって二重の意味を持ちます。ひとつは単純に、日本語コンテンツの品質が実用水準に達したということ。もうひとつは、日本語という条件が、グローバル大手にとって必ずしも優先事項ではないという現実の再確認です。英語圏で標準になったツールが日本語で使い物にならず、結局は国内ベンダーに戻る、という経験をした企業は少なくないはずです。

同社が日本語で強い理由は、実ユーザーの利用データで事後学習しているからだと説明されています。つまり使われるほど、その言語で強くなる設計です。日本のユーザーが多く使えば日本語がさらに良くなる。この構造を理解しておくと、「いま試すこと」が自社の将来の選択肢を広げる行為でもあると分かります。


よくある質問(FAQ)

Q. Fish Audioはいくらで使えますか? A. 無料プランは月8,000クレジット・1回あたり最大500文字です。有料プランは月額15ドル(年払いで月5.5ドル相当)から。加えて、開発者向けAPIは8月末までS2.1 Proが無料、他社からの移行なら3カ月無料、クリエイタープランは50%オフのキャンペーン中です。

Q. 日本語の品質はどうですか? A. 同社は「実ユーザーの選好データで事後学習しているため、日本語・韓国語・中国語・スペイン語・訛りのある英語で強い」と明言しています。日本のユーザーからも「抑揚と間の取り方が読み上げっぽくない」という評価が出ています。ただし用途による差はあるため、無料期間中に自社コンテンツで検証することを推奨します。

Q. 本当にElevenLabsの6分の1なのですか? A. Fish Audio自身の発表による比較です。加えて「コストを50%削減できなければ1年間無料」という保証も出しています。ただし比較条件(プラン・利用量)で結果は変わるため、自社の実際の利用量で試算してください。

Q. 5秒で声を複製できるのは危なくないですか? A. 危険性は現実にあります。経営者の声を複製した送金詐欺は海外で発生しています。技術の導入可否とは別に、「電話の声だけで承認・送金しない」という運用ルールの整備を推奨します。また、他人の声を複製する場合は必ず本人の同意を取ってください。

Q. 企業のセキュリティ要件は満たせますか? A. 同社はオンプレミス展開、データ保持ゼロのポリシー、HIPAA準拠構成に対応していると公表しています。ただし利用形態・契約プランで条件が異なるため、機密データや顧客音声を扱う場合は契約条件の確認が前提です。

Q. 既存のElevenLabsから乗り換えるべきですか? A. 急ぐ必要はありませんが、現在の単価で長期契約を固定するのは避けるべきです。8月末までの無料期間で自社の実コンテンツを生成し、品質・運用性・サポートを確かめてから判断してください。競合の価格改定も想定されます。

Q. 何から試すのが良いですか? A. 「量が必要で、失敗してもやり直せる用途」です。製品デモのナレーション、社内研修コンテンツ、記事の音声版などが向いています。逆に、対外的な公式アナウンスや規制の強い領域は、表示ルールを整理してからにしてください。


まとめ:経営者がいま決めるべき3つのこと

創業1年・22人の会社が5,200万ドルを調達し、業界最大手の6分の1の価格を打ち出した。この事実が示すのは、音声AIが「特別な演出のための高価な道具」から「標準的な部品」へ移行したということです。Claude Opus 5で起きた知能の半額化と同じ現象が、音声で起きています。

経営者として今週から動くなら、次の3つです。

判断を分けるのは、音声AIに詳しいかどうかではありません。「コストが理由で見送った施策」を社内で言語化できているかです。そのリストがある会社は今週すぐ動けますが、無い会社は単価が10分の1になっても何も変わりません。安くなった技術を使えるのは、使いたかったことを覚えている組織だけです。

  1. 8月末の無料期間で検証させる:期限があるのが好都合です。「音声化を見送ったコンテンツ」を1つ選び、実際に作らせて品質を確かめる。検証費用はゼロで、判断材料だけが残ります

  2. 音声関連費用を新しい単価で引き直す:外注費・ツール費・人件費を棚卸しし、6分の1の単価で再計算する。そのうえで「コスト削減に充てるか、量を増やすか」を経営として決める。ここが最大の分岐点です

  3. ボイスフィッシング対策を今すぐ整備する:これは導入の有無と無関係です。5秒で声が複製できる世界になった以上、「電話の声だけで承認・送金しない」ルールは全社の防衛線になります

最後に補足します。この種のニュースへの最頻の反応は「面白いけど、うちには関係ない」です。しかし今回の主役は音声技術そのものではなく、**「コストを理由に見送ってきた施策の前提が崩れた」**という一点にあります。関係あるかどうかは、自社に保留案件のリストがあるかどうかで決まります。それでも様子見を選ぶなら、「独立機関の比較検証が出たら」「競合が価格改定したら」など、条件と期限を明文化してください。無料期間という期限がある以上、条件なき様子見は検証機会を1回捨てるのと同じです。

安くなった技術への正しい態度は、様子見でも飛びつきでもありません。下がった単価を前提に、業務の量と質の設計を組み替えることです。音声は今週、その対象になりました。


出典・参考

本記事は、Fish Audio公式発表・公式サイトおよびSNS上の一次情報(2026年7月30日時点)をもとに構成しています。性能比較・価格比較は同社の発表によるもので、独立機関による検証ではありません。料金・仕様・キャンペーン条件は変更される可能性があります。導入判断の際は必ず最新の公式情報と利用規約をご確認ください。

#FishAudio #音声AI #TTS #ElevenLabs #生成AI #AIコスト #経営判断 #経営者向け #音声合成 #ボイスクローン #DX戦略 #B2Bマーケティング #AIガバナンス #多言語対応 #コンテンツ制作

いいなと思ったら応援しよう!