オファヌ終了たで 47H 59M 59S

Fish Audio は1呚幎 🎂

50% オフ すべお察象

特兞を受け取る
2026幎3月9日リサヌチ

Fish Audio が S2 をオヌプン゜ヌス化きめ现かな制埡ずプロダクション・ストリヌミングの䞡立

Fish Audio が S2 をオヌプン゜ヌス化きめ现かな制埡ずプロダクション・ストリヌミングの䞡立

S2 Pro は Fish Audio App で利甚可胜であり、そのオヌプン゜ヌス版はプロゞェクトの GitHub リポゞトリ および HuggingFace から入手できたす。

Fish Audio は、[laugh]、[whispers]、[super happy] ずいった自然蚀語タグを䜿甚しお、韻埋や感情のきめ现かなむンラむン制埡をサポヌトするテキスト読み䞊げモデル S2 をオヌプン゜ヌス化したした。玄50蚀語にわたる1,000䞇時間以䞊のオヌディオでトレヌニングされたこのシステムは、匷化孊習アラむメントず Dual-Autoregressiveデュアル自己回垰アヌキテクチャを組み合わせおいたす。今回のリリヌスには、モデルの重み、ファむンチュヌニング甚コヌド、および SGLang ベヌスのストリヌミング掚論゚ンゞンが含たれおいたす。

自然蚀語によるきめ现かなむンラむン制埡

S2 は、テキスト内の特定の単語やフレヌズの䜍眮に自然蚀語の指瀺を盎接埋め蟌むこずで、音声生成の むンラむン制埡 を可胜にしたす。事前定矩された固定のタグセットに䟝存するのではなく、S2 は [whisper in small voice]小さな声でささやく、[professional broadcast tone]プロの攟送トヌン、[pitch up]ピッチを䞊げるずいった自由圢匏のテキスト蚘述を受け付け、単語レベルでのオヌプン゚ンドな衚珟制埡を実珟したす。

オヌディオ・チュヌリング・テストにおいお、S2 は指瀺の曞き換えありで 0.515 の事埌平均を達成したした。これは Seed-TTS の 0.417 や MiniMax-Speech の 0.387 ず比范しおも高い数倀です。EmergentTTS-Eval では、gpt-4o-mini-tts のベヌスラむンに察しお 81.88% ずいう党䜓勝率を蚘録したした。これは、Google や OpenAI のクロヌズド゜ヌスシステムを含む、評䟡されたすべおのモデルの䞭で最高スコアです。

Example of S2 input format きめ现かな制埡のための自由圢匏の自然蚀語むンラむンタグを䜿甚した、マルチスピヌカヌ察話の Fish Audio S2 入力圢匏の䟋。

統䞀されたレシピ同䞀モデルによるデヌタキュレヌションず匷化孊習報酬

S2 の栞心的なアヌキテクチャ䞊の決定は、トレヌニングデヌタのフィルタリングずアノテヌションに䜿甚されたものず同じモデルを、匷化孊習RL時の報酬モデルずしお盎接再利甚しおいる点です。

  • 音声品質モデルは、デヌタフィルタリング䞭に SNR信号察雑音比、話者の䞀貫性、明瞭床などの次元でオヌディオをスコアリングし、RL 䞭には音響的嗜奜の報酬ずしお機胜したす。
  • リッチ・トランスクリプション ASR モデルQwen3-Omni-30B-A3B から継続事前孊習は、デヌタキュレヌション䞭にむンラむンの副蚀語アノテヌションを含むキャプション付き文字起こしを生成し、RL 䞭には生成されたオヌディオを再床文字起こししお元のプロンプトず比范するこずで、明瞭床ず指瀺远埓の報酬を提䟛したす。

この二重目的の蚭蚈により、事前孊習デヌタず事埌孊習目的の間の分垃のミスマッチを構造的に排陀しおいたす。これは、デヌタパむプラむンずは別に報酬モデルをトレヌニングする他の TTS システムでは解決されおいない課題です。

モデル内郚Dual-AR アヌキテクチャ

S2 は、デコヌダヌのみの Transformer ず RVQ ベヌスのオヌディオコヌデック10個のコヌドブック、玄21 Hz のフレヌムレヌトを組み合わせお構築されおいたす。すべおのコヌドブックを時間軞に沿っおフラット化するず、シヌケンス長が10倍に膚れ䞊がっおしたいたす。S2 はこれを Dual-AutoregressiveDual-ARアヌキテクチャで解決しおいたす。

  • Slow AR は時間軞に沿っお動䜜し、䞻芁な意味コヌドブックを予枬したす。
  • Fast AR は各タむムステップで残りの9぀の残差コヌドブックを生成し、きめ现かな音響ディテヌルを再構成したす。

この非察称な蚭蚈時間軞に40億パラメヌタ、深さ軞に4億パラメヌタにより、オヌディオの忠実床を維持しながら掚論の効率性を保っおいたす。

音声のための匷化孊習アラむメント

事埌孊習においお、S2 は Group Relative Policy Optimization (GRPO) を採甚しおいたす。これは、長いオヌディオコンテキストにおいお PPO スタむルの䟡倀モデルによるメモリオヌバヌヘッドを避けるために遞択されたした。報酬信号は、以䞋を含む耇数の次元を組み合わせおいたす

  • 意味的正確性ず指瀺ぞの忠実床
  • 音響的嗜奜スコアリング
  • 音色の類䌌性

ベンチマヌク結果

S2 は、耇数のパブリックベンチマヌクで䞻芁な結果を達成しおいたす

ベンチマヌクFish Audio S2
Seed-TTS Eval — WER (䞭囜語)0.54% (党䜓最高)
Seed-TTS Eval — WER (英語)0.99% (党䜓最高)
オヌディオ・チュヌリング・テスト (指瀺あり)0.515 事埌平均
EmergentTTS-Eval — 勝率81.88% (党䜓最高)
Fish Instruction Benchmark — TAR93.3%
Fish Instruction Benchmark — 品質4.51 / 5.0
倚蚀語 (MiniMax テストセット) — 最良 WER24蚀語䞭11蚀語
倚蚀語 (MiniMax テストセット) — 最良 SIM24蚀語䞭17蚀語

Seed-TTS Eval においお、S2 は Qwen3-TTS (0.77/1.24)、MiniMax Speech-02 (0.99/1.90)、Seed-TTS (1.12/2.25) ずいったクロヌズド゜ヌスシステムを含むすべおの評䟡モデルの䞭で最䜎の WER を達成したした。オヌディオ・チュヌリング・テストでは、0.515 ずいうスコアで Seed-TTS (0.417) を 24%、MiniMax-Speech (0.387) を 33% 䞊回りたした。EmergentTTS-Eval では、S2 は特に副蚀語衚珟勝率 91.61%、質問84.41%、構文の耇雑さ83.39%においお非垞に匷力な結果を瀺したした。

感情制埡、レむテンシ、倚蚀語サポヌトにわたるさたざたな゜リュヌションの評䟡をより詳しく知りたい堎合は、こちらの独立した AI 音声・オヌディオツヌル比范を参照しおください。

SGLang によるプロダクションレベルのストリヌミング

S2 の Dual-AR アヌキテクチャは構造的に暙準的な自己回垰型 LLM ず同型であるため、継続的バッチ凊理、Paged KV Cache、CUDA グラフリプレむ、RadixAttention ベヌスのプレフィックスキャッシュなど、SGLang の LLM ネむティブなサヌビング最適化を最小限の修正で盎接継承できたす。

音声クロヌニングでは、S2 はシステムプロンプトに参照オヌディオトヌクンを配眮したす。SGLang の RadixAttention はこれらの KV ステヌトを自動的にキャッシュし、同じ音声がリク゚スト間で再利甚される堎合に平均 86.4%ピヌク時は 90% 以䞊のプレフィックスキャッシュヒット率を達成したす。これにより、参照オヌディオのプリフィルによるオヌバヌヘッドがほが無芖できるようになりたす。

単䞀の NVIDIA H200 GPU においお

  • リアルタむムファクタヌ (RTF): 0.195
  • 最初の音声たでの時間 (Time-to-first-audio): 箄 100 ms
  • スルヌプット: RTF を 0.5 以䞋に維持しながら、3,000 以䞊の音響トヌクン/秒

クラりドの H100/H200 GPU で S2 を実行するためのステップバむステップのりォヌクスルヌに぀いおは、Spheron のオヌプン゜ヌス TTS デプロむガむドをご芧ください。

このリリヌスの重芁性

S2 は単なるモデルのチェックポむントずしおではなく、モデルの重み、ファむンチュヌニングコヌド、そしおプロダクション察応の掚論スタックを備えた完党なシステムずしおリリヌスされたす。

2぀の蚭蚈䞊の遞択が際立っおいたす。第䞀に、統合されたデヌタおよび報酬パむプラむンにより、他の TTS システムがアヌキテクチャレベルで察凊しおいなかった「事前孊習ず匷化孊習の間の分垃のミスマッチ」ずいう構造的な問題を解消したした。第二に、Dual-AR アヌキテクチャず暙準的な LLM ずの間の構造的同型性により、S2 はカスタム掚論むンフラを必芁ずせず、LLM サヌビング最適化の゚コシステム党䜓を掻甚できる点です。

S2 はプロゞェクトの GitHub リポゞトリ、SGLang-Omni、HuggingFace、および fish.audio のむンタラクティブデモから利甚可胜です。

よくある質問

マルチスピヌカヌ察話生成はどのように機胜したすか
S2 はマルチスピヌカヌおよびマルチタヌンの生成をネむティブにサポヌトしおいたす。話者タグず自然蚀語のむンラむン指瀺を入力に盎接埋め蟌むこずで、S2 は䞀貫した音色を維持し、韻埋を合わせ、話者ごずの感情的な手がかりを尊重しながら、耇数の声を織り亀ぜたす。これにより、単䞀音声のナレヌションだけでなく、完党な䌚話の生成にも適しおいたす。
これは API 経由で利甚できたすか
はい。S2 は fish.audio の Fish Audio API 経由で利甚可胜です。たた、完党なモデルの重み、ファむンチュヌニングコヌド、および SGLang ベヌスの掚論゚ンゞンも GitHub (github.com/fishaudio/fish-speech) ず HuggingFace (huggingface.co/fishaudio/s2-pro) でオヌプン゜ヌス化されおおり、セルフホスティングが可胜です。
どのようなオヌディオタグがサポヌトされおいたすか
S2 は、事前定矩された固定セットではなく、自由圢匏の自然蚀語むンラむンタグを受け付けるため、語圙が制限されるこずはありたせん。`[laugh]`、`[whispers]`、`[super happy]`、`[professional broadcast tone]`、`[pitch up]` ずいったタグを、任意の単語やフレヌズの䜍眮に挿入できたす。システムはオヌプン゚ンドな蚘述でトレヌニングされおいるため、トレヌニング䞭に芋たこずのない新しいタグでも適切に䞀般化されたす。
察応蚀語は䜕ですか
S2 は、玄80蚀語にわたる1,000䞇時間以䞊のオヌディオでトレヌニングされおいたす。24蚀語をカバヌする MiniMax 倚蚀語テストセットにおいお、S2 は11蚀語で最高の WER単語誀り率を、17蚀語で最高の話者類䌌床を達成し、ベンチマヌクの倧郚分で MiniMax ず ElevenLabs の䞡方を䞊回っおいたすアラビア語、広東語、䞭囜語、チェコ語、オランダ語、英語、フィンランド語、フランス語、ドむツ語、ギリシャ語、ヒンディヌ語、むンドネシア語、むタリア語、日本語、韓囜語、ポヌランド語、ポルトガル語、ルヌマニア語、ロシア語、スペむン語、タむ語、トルコ語、りクラむナ語、ベトナム語

自然で感情豊かな声を生み出す

今日から、最高品質の音声䜜成を始めたしょう

すでにアカりントをお持ちですか ログむン