悩みから読む へ戻る

会議や取材の録音を、外部に出さずに文字起こしするLocal Transcription

録音を外部に出さずに文字起こしするには、公開されている音声認識のモデル(Whisper)を手元のパソコンで動かし、Apple シリコンの Mac なら音声の長さの 4 分の 1 ほどの時間で起こせます。固有名詞と話者は機械では崩れるので、聞きながら直す時間を 60 分あたり 2〜3 時間見ておきます。

人の名前や取引先の話が入った録音を、手元のパソコンだけで書き起こす方法と、固有名詞と話者を直して指定の書式で納めるまでの段取りです。

公開日 / 書いた人: 墨縄(suminawa)

録音を外部のサービスに上げたくないのは、どんなときですか

  • 社内会議や面接、取材の録音に、人の名前や取引先の話が入っている
  • 相手に「録音は外に出しません」と約束している
  • 文字起こしのサービスは便利だが、どこに保存され、いつ消えるのかが契約書を読まないと分からない

手元のパソコンだけで書き起こすには、何を使いますか

公開されている音声認識のモデル(Whisper)を、手元のパソコンで動かします。音声はパソコンから出ません。Apple シリコンの Mac なら、mlx-whisper という道具で、音声の長さの 4 分の 1 ほどの時間で書き起こせます。60 分の録音なら 15 分前後です。Windows でも同じモデルを動かす道具があり、速さは機械の性能で変わります。

  1. 録音を 16 kHz のモノラルの音声に変換します(ffmpeg という無料の道具で 1 行)
  2. モデルは「large-v3-turbo」を選びます。日本語の精度と速さの釣り合いがよく、初回だけモデルの取得(1.6 GB ほど)があります
  3. 出力は、開始と終了の時刻がついた区間の並びです。これを Excel や Word に流し込みます

精度の癖は、固有名詞が崩れることです。会社名や商品名、人名は聞いて直す前提にします。数字と敬体の文は安定しています。

納品までの段取りは、どう組みますか

  1. 機械で起こす: 時刻つきの区間を Excel(開始・終了・話者・本文・備考の 5 列)と SRT に出します。話者の列は空欄にしておきます
  2. 聞きながら直す: 固有名詞、言い直し、相づちを直し、話者の列を埋めます。60 分の対談で 2〜3 時間。ここが仕上がりを決めます
  3. 指定の書式へ: 依頼主の書式(Word の段落、1 分ごとの時刻、発言者の見出しなど)に合わせて整えます。SRT は字幕にそのまま使えます

「ケバ取り」(えー、あの、を消す)や「整文」(話し言葉を書き言葉に直す)をどこまでやるかは、始める前に決めます。取材記事の素材なら整文まで、議事録なら発言のまま、が多いです。

AI 書類読み取りの見本。読み取った項目と検算の画面
書類の読み取りも同じ考え方(機械で読む → 人が確かめる)です ── AI 書類読み取りの見本を開く

文字起こしを頼めますか

録音を外部に送らず、手元で起こして、時刻つきの Excel と Word、字幕用の SRT でお納めします。固有名詞と話者は聞きながら直します。60 分 6,000 円から ── ココナラ

会議の録音から決定事項と宿題を分けた議事録まで作る形は、問い合わせメールの仕分けと同じ「機械で読んで人が確かめる」組み方です。ご相談は hello@suminawa.dev へ。3 営業日以内に返信します。

見本・キット・ご相談