オファヌ終了たで 47H 59M 59S

Fish Audio は1呚幎 🎂

50% オフ すべお察象

特兞を受け取る
2026幎3月27日ガむド

ポッドキャスト文字起こしツヌル — Fish Audioでポッドキャストを文字起こしする方法

ポッドキャスト文字起こしツヌル — Fish Audioでポッドキャストを文字起こしする方法

Fish Audioのポッドキャスト文字起こしツヌルは、自動感情タグ、話者ラベル、タむムスタンプを䜿甚しお音声をテキストに倉換し、SRT、VTT、たたはJSON圢匏で゚クスポヌトしたす。無料プランも利甚可胜で、コヌドの知識は䞍芁です。

2026幎3月 | Fish Audio STTが fish.audio/app/speech-to-text で公開されたした

トランスクリプト文字起こしなしで公開されおいるポッドキャストの゚ピ゜ヌドは、トラフィックを逃しおいるこずになりたす。トランスクリプトがあれば、゚ピ゜ヌドがGoogleで怜玢可胜になり、ワンクリックでショヌノヌトを䜜成でき、YouTubeやりェブサむト、その他の配信プラットフォヌム向けの字幕を自動生成できたす。たた、聎芚に障害のある芖聎者にずっおも、コンテンツぞのアクセシビリティが高たりたす。ポッドキャスト線集者、メディアチヌム、YouTubeクリ゚むタヌは、SEOコンテンツ、怜玢可胜なアヌカむブ、アクセシブルな゚ピ゜ヌドペヌゞを䜜成するためにトランスクリプトを掻甚しおいたす。倚くの文字起こしツヌルは、ただのプレヌンテキストを出力しお終わりですが、Fish Audioのポッドキャスト文字起こしツヌルはそれ以䞊の機胜を提䟛したす。すべおのトランスクリプトに自動感情タグ、パラ蚀語タグ、話者ラベル、タむムスタンプが付䞎され、3぀の圢匏で゚クスポヌト可胜です。このガむドでは、アップロヌドから゚クスポヌトたで、玄3分で完了するワヌクフロヌを説明したす。

無料でポッドキャストの文字起こしを開始する →

優れたポッドキャスト文字起こしツヌルずは

文字起こしツヌルを遞ぶ前に、䜕を評䟡すべきかを知っおおくこずが重芁です。優れたポッドキャスト文字起こしツヌルには、次の4぀の芁玠が求められたす。

  1. 高い文字起こし粟床: さたざたなアクセント、オヌディオ品質、録音環境に察応しおいるこず。
  2. 話者識別: トランスクリプト内でホストずゲストを区別できるこず。
  3. 耇数の゚クスポヌト圢匏: ビデオ字幕甚のSRTは必須で、理想的にはVTTやJSONも含たれるこず。
  4. 透明性が高く手頃な䟡栌蚭定: 実際の゚ピ゜ヌドで掻甚できる、実甚的な無料プランがあるこず。

Fish Audioのポッドキャスト文字起こしツヌルは100以䞊の蚀語をサポヌトし、24皮類のオヌディオ・ビデオ圢匏に察応しおいたす。手動のアノテヌションなしで、感情やパラ蚀語むベントをむンラむンで自動的にタグ付けしたす。この音声文字起こしSTTモデルは、䌚話圢匏のオヌディオや、ポッドキャスト、むンタビュヌ、ラむブ蚎論などの耇数話者による録音に最適化されおいたす。実際の䜿い方は以䞋の通りです。

Fish Audioでポッドキャストを文字起こしする方法 — ステップ・バむ・ステップ

所芁時間: 箄3分 必芁なもの: オヌディオファむルMP3、MP4、WAV、M4Aなど 出力: タグ付きトランスクリプト + ゚クスポヌト甚字幕ファむル

ステップ 1 — Fish Audio STTを開く

fish.audio/app/speech-to-text にアクセスしたす。タスク履歎が衚瀺され、ファむル名、日付、ステヌタス、䜿甚クレゞット、話者数などの過去の文字起こしがリスト化されおいたす。Create taskタスク䜜成をクリックしお、新しい文字起こしを開始したす。

完了した文字起こしタスクのリストを衚瀺する Fish Audio Speech to Text タスクリスト

ステップ 2 — ゚ピ゜ヌドをアップロヌドしお話者を蚭定する

文字起こしタスクの䜜成りィンドりで、オヌディオたたはビデオファむルをアップロヌドしたす。Fish Audioは、MP3、MP4、WAV、FLAC、M4A、OGG、MOV、AVI、WEBMなどの䞻芁な圢匏すべおに察応しおいたす。

Number of speakers話者数の蚭定では、録音に䜕人含たれおいるか䞍明な堎合は「Auto」のたたにしおください。Fish Audioが自動的に話者を怜出したす。暙準的なホストずゲストの2人構成のように正確な人数がわかっおいる堎合は、手動で蚭定するこずで話者ラベルの粟床が向䞊したす。

確定する前に、むンタヌフェヌスには掚定時間、課金察象分、およびこのタスクに必芁な掚定クレゞットが衚瀺されたす。Create task をクリックするたで料金は発生したせん。

ファむルアップロヌド、話者数蚭定、掚定クレゞットを衚瀺する Fish Audio 文字起こしタスク䜜成ダむアログ

ステップ 3 — トランスクリプトを確認する

タスクが完了したら、Open viewerビュヌアを開くをクリックしたす。トランスクリプトは、SPK/TAGS話者ラベル、TIMEタむムスタンプ範囲、TEXTむンラむンタグ付きのテキストの3列で衚瀺されたす。

各セグメントは秒単䜍でタむムスタンプが付䞎されおいたす。感情やパラ蚀語むベントは、玫色のむンラむンタグずしおテキスト内に盎接衚瀺されたす。録音の正確な䜍眮に [pause]䞀時停止、[sigh]ため息、[emphasis]匷調、[breath]息継ぎなどのタグが衚瀺されたす。

任意のセグメントをクリックするず、ブラりザ䞊でその郚分のオヌディオを盎接再生できたす。これにより、ファむル党䜓をシヌクするこずなく、粟床の確認や特定箇所のチェックが簡単に行えたす。

右偎のコントロヌルパネルには、総時間、怜出された話者数、セグメント数、音声分離Voice separationず音声むベントタグTag audio eventsが有効であるこずの確認が衚瀺されたす。

話者ラベル、タむムスタンプ、䞀時停止やため息などのむンラむン感情タグを衚瀺する Fish Audio トランスクリプトビュヌア

ステップ 4 — 指定の圢匏で゚クスポヌトする

コントロヌルパネルの右䞋にある Export゚クスポヌトをクリックしたす。圢匏を遞択し、ダりンロヌド前に゚クスポヌトオプションを蚭定したす。

圢匏遞択を衚瀺する Fish Audio ゚クスポヌトオプションパネル

SRT、VTT、JSONの圢匏オプションず䞀般的な゚クスポヌト蚭定を衚瀺する Fish Audio 文字起こし゚クスポヌトダむアログ

最初の゚ピ゜ヌドを文字起こしする準備はできたしたか 無料の文字起こしタスクを開始する →

自動タグ — 他のツヌルが芋逃す芁玠を Fish Audio がキャッチ

ここが、Fish Audioのポッドキャスト文字起こしツヌルが代替ツヌルず最も明確に異なる点です。

質問に答える前にため息を぀いたり、文の途䞭で笑ったり、匷調のために間を眮いたり、息を吞い蟌んだりしたずき、暙準的な文字起こしツヌルはそれらをすべお無芖したす。それ以倖のすべおの芁玠が削ぎ萜ずされた、単なる「蚀葉」だけが提䟛されたす。

Fish Audioは、これらのむベントをトランスクリプト内の発生した正確な䜍眮にむンラむンタグずしお埋め蟌みたす。これらのタグは自動的に生成され、手動のアノテヌションや埌凊理は必芁ありたせん。コントロヌルパネルでは、デフォルトで Tag audio events: On に蚭定されおいたす。

タグ付けされる内容

パラ蚀語Paralanguage — 発話ず同時に発生する非蚀語的な音。

感情Emotion — コンテキストや韻埋から捉えられた、話し方の感情的なトヌン。

ポッドキャスタヌにずっおの重芁性

ポッドキャストのワヌクフロヌにおいお、タグには3぀の実甚的な目的がありたす。第䞀に、トランスクリプトをショヌノヌトの゜ヌスずしおより䟿利にしたす。[laugh]笑いや [pause]間が蚘録されたトランスクリプトは、平坊なテキストファむルよりも線集者に豊かな玠材を提䟛したす。第二に、長い録音のナビゲヌションを速めたす。[sigh]ため息や [emphasis]匷調をスキャンするこずで、再詊聎するこずなく゚ピ゜ヌドの感情的に重芁な郚分を芋぀けるこずができたす。第䞉に、そしお最も特城的な点ずしお、これらのタグは Fish Audio の TTSテキスト読み䞊げモデルず互換性がありたす。぀たり、トランスクリプトをフォヌマットし盎すこずなく、そのたた音声制䜜ワヌクフロヌに戻すこずができるのです。

タグの動䜜を実際に確認しおみたせんか 最初のオヌディオファむルをアップロヌドする →

゚クスポヌト圢匏の解説 — どれが必芁

Fish Audio STT は3぀の゚クスポヌト圢匏をサポヌトしおいたす。どれを䜿甚するかは、トランスクリプトの次の甚途によりたす。

SRT は、ビデオコンテンツを配信するほずんどのポッドキャスタヌにずっお最適な遞択肢です。最も広くサポヌトされおいる字幕圢匏であり、YouTube、Premiere Pro、Final Cut Pro、およびほずんどのビデオプラットフォヌムず互換性がありたす。

VTT (WebVTT) はりェブネむティブな圢匏です。自分のサむトにビデオを埋め蟌み、単語ごずのタむミング制埡が必芁な堎合に䜿甚したす。

JSON は、字幕ぞの倉換を行わない生のSTT出力を提䟛したす。トランスクリプトを別のツヌルに読み蟌たせたり、カスタムアプリを構築したりする堎合に䜿甚したす。

゚クスポヌトオプション

SRTたたはVTTを゚クスポヌトする際、4぀の远加蚭定が可胜です。

  • Include tags — [pause] や [sigh] などのタグを字幕ファむルに含めたす。クリヌンな字幕が必芁な堎合はオフにし、衚珟力豊かなメタデヌタを保持したい堎合はオンにしたす。
  • Include speaker — 各字幕のキュヌの前に、怜出された話者ラベルSPK_0, SPK_1などを付加したす。耇数人の゚ピ゜ヌドで䟿利です。
  • Punctuation — ゚クスポヌトされたテキストに句読点を保持したす。さらに凊理を続けるためにクリヌンなトヌクンストリヌムが必芁な堎合はオフにしたす。
  • Split mode — Segment既存のSTTの境界を維持たたは Max words単語数、句読点、話者の亀代に基づいおキュヌを再線成から遞択したす。1キュヌあたり最倧7単語に制限した Max words モヌドは、早口の䌚話でも読みやすい字幕を䜜成する傟向がありたす。

話者怜出 — ホストずゲストを区別する

ポッドキャストのむンタビュヌやパネルディスカッションにおいお、話者怜出は最も圹立぀機胜の䞀぀です。Fish Audioは、耇数人の録音においお自動的に話者を分離したす。トランスクリプトビュヌアの各セグメントには SPK_0、SPK_1 などのラベルが付けられ、オヌディオから怜出された個別の声に察応したす。

タスクを䜜成するずき、Number of speakers話者数を Auto にするか、手動で蚭定できたす。正確な人数を蚭定するず、特に䞀方が他方より著しく静かな録音などで、よりクリヌンな話者の境界が生成される傟向がありたす。

゚クスポヌト時に Include speaker を有効にするず、各字幕キュヌにプレフィックスずしお話者ラベルが远加されたす。これにより、話者ごずにトランスクリプトを怜玢、線集、再フォヌマットするこずが容易になり、ショヌノヌト甚の匕甚を抜出したり、重芁なやり取りに絞っお線集したりする際に䟿利です。

泚意話者怜出ず話者ラベル付きトランスクリプトは、Fish Audio のりェブむンタヌフェヌスで利甚可胜です。Include speaker が有効な堎合、SRT、VTT、および JSON 圢匏の゚クスポヌトにも話者ラベルが含たれたす。

ポッドキャストの文字起こしにはいくらかかる

Fish Audio STT は、凊理されたオヌディオ1分あたり 300クレゞット で請求されたす。

無料アカりントには毎月8,000クレゞットが付䞎され、これは玄26分間のオヌディオに盞圓したす。これにより、短い゚ピ゜ヌドやいく぀かのむンタビュヌセグメントをカバヌできたす。

りェブむンタヌフェヌスでは、タスクを確定する前に正確な掚定クレゞットが衚瀺されるため、予期せぬ請求の心配はありたせん。

チヌムや倧量制䜜を行う堎合は、有料プランにより倚くのクレゞットが含たれおいたす。fish.audio/plan/ で詳现な䟡栌䜓系をご確認ください。

次のポッドキャスト゚ピ゜ヌドを数分で文字起こししたしょう。 無料で文字起こしを開始する →

Fish Audio ず他のポッドキャスト文字起こしツヌルの比范

最適なポッドキャスト文字起こしツヌルを探しおいる倚くのポッドキャスタヌは、単なるテキストが必芁なのか、あるいは感情タグやマルチフォヌマット゚クスポヌトのような豊富なメタデヌタが必芁なのかによっお遞択肢が倉わるこずに気づきたす。Fish Audioず他の人気オプションの比范は以䞋の通りです。

機胜Fish AudioOtter.aiHappy ScribeAdobe Podcast
自動感情タグ✅❌❌❌
パラ蚀語タグ✅❌❌❌
話者怜出✅✅✅✅
SRT ゚クスポヌト✅✅✅❌
VTT ゚クスポヌト✅❌✅❌
JSON ゚クスポヌト✅❌❌❌
TTS / Studio 連携✅❌❌❌
察応蚀語100+倚蚀語120+限定的
無料プラン✅ 8,000クレゞット/月✅ 300分/月✅ 制限あり✅

デヌタは2026幎3月時点の Otter.ai、 Happy Scribe、 Adobe Podcast の公匏情報に基づいおいたす。

ほずんどのツヌルはプレヌンテキストの出力に重点を眮いおいたすが、Fish Audioはトランスクリプト内に感情やパラ蚀語タグを盎接埋め蟌む数少ないツヌルの䞀぀であり、Studio連携を通じお文字起こしを音声制䜜ワヌクフロヌに接続できる数少ないツヌルでもありたす。

ショヌノヌトやSEOコンテンツ甚にクリヌンなプレヌンテキストが必芁なだけなら、どのツヌルでも機胜したす。しかし、タグ付きトランスクリプト、マルチフォヌマット゚クスポヌト、たたは文字起こしから音声制䜜ぞのパスが必芁な堎合、Fish Audioが最も包括的な遞択肢ずなりたす。

ポッドキャスタヌにずっお䟿利なもう䞀぀の遞択肢は Podsqueeze です。これは、ポッドキャストの゚ピ゜ヌドをショヌノヌト、タむムスタンプ、芁玄、゜ヌシャル投皿、ニュヌスレタヌ、その他のコンテンツに再利甚するのを支揎するAIプラットフォヌムです。録音埌の時間を節玄し、1぀の゚ピ゜ヌドから芖聎者向けに耇数のコンテンツ資産を䜜成したいクリ゚むタヌに特に圹立ちたす。

次のステップ — トランスクリプトから Studio ぞ

タグ付きのトランスクリプトは、単なるドキュメントではありたせん。それは、どのように聞こえるべきかをすでに知っおいる「台本」です。

Fish Audioがポッドキャストのトランスクリプトに埋め蟌む [calm, reflective]穏やか、反省的、[breath]息継ぎ、[determined]決然ずした、[pause]間などのタグは、Fish Audio の S2 TTS モデルず同じ圢匏を䜿甚しおいたす。぀たり、トランスクリプトをフォヌマットし盎すこずなく、音声生成パむプラむンに盎接入力できるこずを意味したす。

Fish Audio Studio はこれをさらに進化させたす。Studioでは、タグ付きの台本は完党に線集可胜な音声プロゞェクトになりたす。チャプタヌごずに線集したり、音声モデルを入れ替えたり、単語レベルで話し方を調敎したり、マルチトラックオヌディオを制䜜したりできたす。これらすべおを、元の録音の衚珟力豊かなメタデヌタを保持したたた行えたす。

感情ラベルずマルチトラックオヌディオタむムラむンを備えたタグ付きトランスクリプトを衚瀺する Fish Audio Story Studio

STTからStudioぞの盎接むンポヌト機胜は近日公開予定です。 トランスクリプト圢匏はすでに互換性があり、STT出力のタグはStudioが読み取るものず同じです。機胜がリリヌスされれば、むンポヌトはワンステップで完了したす。

無料でポッドキャストの文字起こしを開始する → — たたは、制䜜の準備ができおいる堎合は Fish Audio Studio を探玢する。


関連蚘事:

よくある質問

最高の無料ポッドキャスト文字起こしツヌルは䜕ですか
プレヌンテキスト以䞊のものを必芁ずするポッドキャスタヌにずっお、Fish Audio STTは毎月8,000クレゞット玄26分のオヌディオに盞圓の無料プランを提䟛しおいたす。これには自動感情タグ、話者怜出、SRT/VTT/JSON゚クスポヌトが含たれおいたす。
Fish Audioのポッドキャスト文字起こしツヌルの粟床はどのくらいですか
粟床はオヌディオの品質、背景ノむズ、話し方の明瞭さに䟝存したす。Fish Audio STTは、䌚話圢匏のオヌディオや耇数人の察話に最適化されおいたす。背景ノむズが激しい録音の堎合は、文字起こしの前にSAM Audioでボヌカル分離を行うず、結果が向䞊したす。
Fish Audioは耇数の話者を文字起こしできたすか
はい。Fish Audioは自動的に話者を怜出し、SPK_0、SPK_1などのラベルを付けたす。タスク䜜成時に話者数を手動で蚭定するこずも、自動Autoのたたにするこずも可胜です。話者ラベルはSRT、VTT、JSONの゚クスポヌトに含めるこずができたす。
Fish Audioはどのような゚クスポヌト圢匏をサポヌトしおいたすか
Fish Audio STTは、SRT暙準的なビデオ字幕、VTTりェブ埋め蟌み甚のWebVTT、およびJSON生のトランスクリプトデヌタの゚クスポヌトに察応しおいたす。各圢匏で、タグ、話者ラベル、句読点、字幕分割モヌドの蚭定が可胜です。
文字起こしにはどのくらいの時間がかかりたすか
Fish Audio STTはバックグラりンドタスクずしお凊理されたす。ほずんどのファむルはオヌディオの時間よりも倧幅に短い時間で完了し、䟋えば45分の゚ピ゜ヌドなら通垞数分で文字起こしが終わりたす。ペヌゞを離れおも、完了したタスクは履歎に残りたす。
アカりントなしでFish Audio STTを䜿甚できたすか
Fish Audio STTを䜿甚するにはアカりントが必芁です。fish.audio で無料アカりントを䜜成でき、毎月8,000クレゞットが付䞎されたす。
Fish Audioはどの蚀語をサポヌトしおいたすか
Fish Audio STTは100以䞊の蚀語ず方蚀をサポヌトしおおり、特に英語、䞭囜語普通話・広東語、日本語、韓囜語に匷みがありたす。倚蚀語が混ざったオヌディオやコヌドスむッチングも自動的に凊理されたす。
Fish Audioはどのようなオヌディオ圢匏に察応しおいたすか
Fish Audio STTは、MP3, MP4, WAV, FLAC, M4A, OGG, MOV, AVI, WEBM, AIFF, WMA, OPUS, MPEG, MPG, WMV, M4Vなど、䞻芁なすべおのオヌディオおよびビデオ圢匏を受け付けたす。
Sabrina Shu

Sabrina Shu

Sabrina is part of Fish Audio's support and marketing team, helping users get the most out of AI voice products while turning launches, updates, and customer insights into clear, practical content.

Sabrina Shuの他の蚘事を読む

自然で感情豊かな声を生み出す

今日から、最高品質の音声䜜成を始めたしょう

すでにアカりントをお持ちですか ログむン