AivisSpeechの使い方と関連ツールやAPI活用などまとめて解説!
今回の記事は、AivisSpeech含めAivis Project関連ツールの使い方紹介やAPI活用などをまとめた内容になっています。
AivisSpeechはStyle-Bert-VITS2の技術をもとに、感情豊かな合成音声を簡単に生成できます。
また、音声合成だけでなく、音声モデルを共有できるAivisHubや、Style-Bert-VITS2の音声モデルをAivisSpeechで使えるようにするAIVM Generator、AivisSpeech-EngineのAPI活用まで解説していきます。
※本記事の最終更新:2025/10/14
Aivis Project概要
冒頭でも触れた通り、Aivis Projectでは感情豊かな音声合成を誰でも活用できるビジョンを持って活動しているプロジェクトになっています。
感情豊かな合成音声を簡単に生成でき、ソフトウェア本体はクレジット表記不要で、個人・法人・商用・非商用を問わず、自由に使用できます。
また現状は全て無料で使用でき、今後も基本的な機能(少なくとも今出ているもの)は同じく無料で使えるようです。
詳細は公式サイトをご覧ください。
AivisSpeech

AivisSpeechは合成音声ソフトで、UI/UXがVOICEVOXを参考に作られているため誰でも直感的に操作することができるかと思います。
インストールして合成音声で読み上げ
まずはソフトのインストールからしていきます。
ホームページから「AivisSpeechをダウンロード」を押下して、そこからインストールできます。

現状WindowsとMacの両方に対応しています。
今回はWindowsでインストーラー版のダウンロードを行いました。

インストーラー版を選択したらexeファイルがダウンロードされるので、それを実行していきます。
その後は表示に従ってインストールしていけばOKです。
インストールが完了してAivisSpeechを起動するとエディタが開きます。

この入力欄にテキストを入れて再生ボタンを押下すると、選択モデルの合成音声でテキスト内容を読み上げてくれます。
設定で辞書登録も可能ですが、デフォルトでも英単語や特定の単語などは上手く発音してくれることも嬉しいポイントですね。

各種パラメータの調整や設定方法は基本的にVOICEVOXと同様なのと、既に分かりやすいUI/UXとなっているので割愛します。
※音声モデルのインストール方法は実際にモデル作成する方法と一緒にまとめて後半に解説
エンジンモードをGPUにする
見落としがちですが、初期設定ではエンジンモードがCPUになっているので、GPUに変更する方法を紹介しておきます。
音声生成の速度に差が出てくるので個人的に重要な設定です。
※GPUモードの利用はdGPU搭載のPCが必要
上のメニューから設定を選択 > オプションをクリック

エンジンモードをCPUからGPUに変更

これで完了です。他にも色々と便利になる設定があるのでチェックしてみてください!
AIVM Generator
AIVM GeneratorはAivisSpeechで使える 音声合成モデルファイル (AIVM / AIVMX) を、簡単に作成・編集できるツールです。
現状ではStyle-Bert-VITS2で作成した音声モデルをAivisSpeechで使えるようにすることができます。
ちなみにStyle-Bert-VITS2で音声モデルを作成する方法については下記にて解説しているのでこちらをご覧ください。
Style-Bert-VITS2の音声モデルをAivis用に変換する
Style-Bert-VITS2で作成した音声モデルからAIVM / AIVMXファイルに変換してAivisSpeechで使えるまでの手順を紹介していきます。
まずStyle-Bert-VITS2のApp.batから起動できるWebUI上で、変換したい音声モデルの.onnxファイルを作成します。

AIVM GeneratorでAivisSpeexh用に変換するモデルを選択

Style-Bert-VITS2モデルの各ファイル(.safetensors / .onnx / config.json / style_vectors.npy)を選択します。
※Style-Bert-VITS2のmodel_assetsフォルダ内に全てあるはずです

メタデータ編集で必要な情報を入力。
制作者、モデルの説明、モデル名、モデルアイコンなど。

ライセンスについてはこちらを確認してください。

各種入力して生成ボタンを押下すると.aivmxと.aivmファイルをダウンロードできます。
これでStyle-Bert-VITS2で作成した音声モデルをもとにAIVM / AIVMXファイルを作成することができました。
AivisSpeechにAIVMXファイルをインストール
AIVM / AIVMXファイルを作成できたら実際にAivisSpeechで読み上げさせてみたいと思うので、その手順を解説していきます。


①右上の「インストール / 更新」ボタンを押下
②「ファイルからインストール」を押下して先ほど作成したAIVMXファイルを選択
③右下の「インストール / 更新」を押下して完了

そうするとエディタの話者選択で追加した音声モデルを選択出来て読み上げさせることができるようになります。
※モデル追加後に再起動、再ロードが必要
AivisHub
続いてAivisHubについて紹介します。
こちらのAivisHubは公式やユーザーが作成した合成音声モデルを共有・ダウンロードできるサイトです。
つまり、先ほど作成したAIVM / AIVMXのプラットフォームのようなもので、自分が作成した音声モデルを誰でも使えるよう共有したり、逆に誰かが作成した音声モデルをダウンロードできたりします。

公開されている各音声モデルを選択して、ダウンロードボタンからダウンロードすることでAivisSpeechにて使用できます。
AivisSpeech-EngineのAPI
https://github.com/Aivis-Project/AivisSpeech-Engine
AivisSpeech-Engineは、VOICEVOX-ENGINEをベースにした日本語音声合成エンジンとして提供されています。
AivisSpeechエディタを起動した状態で、http://localhost:10101/docsにアクセスするとSwaggerが開いてAPI仕様を確認することができます。

PythonでAPI使ってみる
実際にAivisSpeech EngineのAPIを使ってPythonで動くサンプルコードを下記に残します。
import io
import json
import soundfile
import requests
class AivisAdapter:
def __init__(self):
# AivisSpeechを起動しておいてください
self.URL = "http://127.0.0.1:10101"
# 話者ID (話させたい音声モデルidに変更してください)
self.speaker = 1234567890
def save_voice(self, text: str, output_filename: str = "output.wav"):
params = {"text": text, "speaker": self.speaker}
query_response = requests.post(f"{self.URL}/audio_query", params=params).json()
audio_response = requests.post(
f"{self.URL}/synthesis",
params={"speaker": self.speaker},
headers={"accept": "audio/wav", "Content-Type": "application/json"},
data=json.dumps(query_response),
)
with io.BytesIO(audio_response.content) as audio_stream:
data, rate = soundfile.read(audio_stream)
soundfile.write(output_filename, data, rate)
def main():
adapter = AivisAdapter()
while True:
text = input("> ")
if text.lower() == "q":
break
adapter.save_voice(text)
if __name__ == "__main__":
main()
これを実行してターミナルで読み上げさせたい文言を入力して実行すると、同階層にoutput.wavとして入力した文言の読み上げ音声ファイルが書き出される処理になっています。
※API使う時はAivisSpeechエディタの起動を忘れずに
話者指定について
話者については、http://localhost:10101/speakers から話者idをコピーしてコード内のself.speaker = 1234567890のところに入力すればOK!
プリティプリントの箇所にチェックを入れると見やすいです。
さいごに
今回はAivisSpeechを中心に、Aivis Projectのツール群やAPI活用について紹介・実践してきました。
sbv2に比べてインストールや環境構築のハードルが下がり、誰でも簡単に感情豊かな合成音声を扱えるようになったのは感動ですね!
AIキャラクターやAIVtuberなどにも適しているツールだと思います。
ぜひ参考に、AivisSpeechを体験してみてはいかがでしょう!
以上!それではまた👋
追記①:
音声素材の準備→sbv2で音声学習→AivisSpeech用に変換までを一気通貫でまとめている記事を作成しました!
追記②:
Aivis Cloud APIの記事を作成しました!
