非エンジニアが「ローカルでAI文字起こし」を試してみた——精度にちょっと驚いた話

手元のPCでAIに音声を文字起こしさせるイメージ AIツール

① なぜ音声を文字起こししたいと思ったか

私はふだん、記事や文章を書く機会がそれなりにあります。ただ、書きたいことや経験したことを、その都度キーボードで文字にしていくのは、地味に手間がかかります。そこで、「思いついたことや話したいことを、まず声で残しておいて、あとから文字にできたら、書くときの素材になって楽なんじゃないか」と考えました。声で話すほうが、キーボードを打つより気軽ですしね。

それが、音声を文字起こしする仕組みを試してみようと思ったきっかけです。といっても、まだ本格的に使い始めたわけではなく、これから、という段階です。

② 手元のPCでAI文字起こし環境を作ってみた

結論から言うと、専門知識がなくても「自分のパソコンの中でAIに文字起こしをさせる」環境は、思っていたより手が届く範囲でした。

今回使ったのは Whisper(ウィスパー) という、音声を文字に変換してくれるAIです。ネット上のサービスに音声を送るのではなく、自分のパソコンの中(ローカル)で動かすやり方を選びました。

  • ローカルで動かすとは、外部のサービスにアップロードせず、手元のパソコンだけで処理を完結させること
  • そのため、画像や動画の処理と同じように、パソコンの計算力(GPU=画像や大量計算が得意な部品)を使って動かします

私はプログラミングもターミナル(黒い画面にコマンドを打って操作するツール)も初心者ですが、AIに日本語で相談しながら、少しずつ準備を進めました。細かい手順の全部をここで解説はしませんが、雰囲気としては——

  • 「文字起こしをするAI(Whisper)を、自分のパソコンで動くように用意する」
  • 「試しに手元の音声ファイルを1つ渡してみる」
  • 「出てきた文字を確認する」

という流れです。専門家でなくても、順番に進めれば「とりあえず動かしてみる」ところまではたどり着けました。

実際に自分の声のメモを渡してみると、ちゃんと文字になって出てきました。もちろん完璧ではなくて、細かい文字の間違いや、自分の言い間違いまではさすがに拾いきれない部分もあります。でも「話した内容が、あとから読み返せる文字になっている」という一点だけで、想像より十分に使えるな、というのが正直な感想でした。

一番「お、すごい」と思ったのは、特別な設定をいじったわけでもないのに、動かしてみたら普通にちゃんと文字が起こされて出てきた瞬間です。難しく身構えていたぶん、あっけなく動いたことに拍子抜けするくらいでした。

手元のPCでAI文字起こしをする3ステップ。①Whisperを用意する→②音声を渡す→③出てきた文字を確認する

③ 実際にテストしてみたら…

いちばん驚いたのは、精度でした。私は自分でも自覚があるくらい早口で、正直、自分の声のメモは聞き返しても聞き取りづらいことがあります。試しにその”聞き取りづらいはずの自分の声”を渡してみたのですが——出てきた文字は、早口の部分まで、ちゃんと正しく起こされていました。「え、こんなに正確なんだ」と、素直にすごいと思いました。

自分でも聞き取りに苦労するような声が、そのまま読める文字になって出てくる。その体験は、思っていた以上の手応えがありました。

④ どんな人に便利そうか

まだ試した段階ですが、「これは使えそうだ」と感じた場面をいくつか挙げてみます。

  • 音声メモをよく取る人:思いついたことを声で残しておいて、あとで文字にしたい人
  • 会話や打ち合わせを振り返りたい人:自分用のメモとして、話した内容を文字で残しておきたいとき
  • 書くのが苦手・面倒な人:まず声で話して、それを文字の下書きにしてしまう使い方
  • 私のように「あとで見返すのが面倒」な人:声のままだと探しにくいものを、検索できる文字にできる

私自身、「面倒くさがり」なところがあるので、「一度声で出しておけば、あとは文字にしてくれる」という流れは相性が良さそうだと感じました。

⑤ まとめ

今回は「自分のパソコンでAIに音声を文字起こしさせる環境を作って、試しに動かしてみた」ところまでの記録でした。まだ本格的に使い込んだわけではありませんが、手元で音声が文字に変わるという体験そのものが、素直に面白かったです。

実はこの記事を書くにあたっても、頭の中の考えを一度声に出して録音し、それを文字起こししてから整理する、という使い方を試してみました。キーボードに向かうより先に、思ったことを喋ってしまうほうが、私にはラクだったんです。まだ使い倒しているわけではないけれど、こうして「声から下書きをつくる」のは、この先ブログやnoteを書くときにも役立ちそうだ、という手応えがあります。

じゃあ何から始めればいいの?と思う人に、私がひとつだけ言えるのは——まずは「声を録るところ」から始めるのがおすすめ、ということです。文字起こしのツールを完璧に用意することより、「とりあえずスマホで自分の声を録音してみる」ほうが、ずっとハードルが低い。録音は、文字を打つよりよっぽど簡単だからです。手元に音声が1つあれば、それを文字にしてみる、という次のステップに自然につながります。だから最初の一歩は、道具選びより「声を残してみる」こと。ここから始めれば、文字起こしのありがたみが一番わかりやすいと思います。

初心者でも、AIに相談しながら進めれば「まず動かしてみる」ところまでは届く——それが今回いちばんの収穫でした。

このあと実際に使ってみてどうだったのかは、次の章に追記しました。

⑥ 【追記】2か月使ってみて——実は、あまり使わなかった

ここまでは、試した直後の記録です。その後約2か月が経ったので、正直なところを追記しておきます。

結論から言うと、あまり使いませんでした。

試したときは「これは便利だ」と思ったのに、日常には入らなかった。この手の話は、あまり書かれない気がするので、その理由ごと残しておきます。

使わなかった理由

思ったことだけを録音するのが、意外と大変だった——これに尽きます。

声で話すには、先に「何を話すか」が頭の中でまとまっていないといけません。ところが文字だと、書きながら考えられる。途中で止まってもいいし、戻って直せもする。

この記事の中で、私は2回「声のほうが楽だ」と書いています。冒頭では「声で話すほうが、キーボードを打つより気軽」と書き、まとめでは「思ったことを喋ってしまうほうが、私にはラクだった」と書きました。

でも、2か月使ってみたら、いつもそうとは限らなかったんです。

でも、使い分けの線は見えた

使わなかったとはいえ、まったく使えないと思ったわけではありません。むしろ、どこで分かれるのかがはっきりしました

  • 一気に伝えたいことがあるとき……声のほうが速い。文字を打つのが大変な量になるので、喋ってしまったほうが早い
  • 短いやりとり……文字のほうが速い。録音して文字にして……という手間のほうが勝つ

つまり、どちらが優れているかではなく、量で分かれるということでした。この線引きは、試した直後には見えていませんでした。しばらく使わない期間を挟んで、やっと分かったことです。

道具は悪くなかった

ひとつはっきりさせておくと、使わなかった理由は、道具の性能とは関係ありません。 文字起こしの精度は、前に書いたとおり十分でした。

使わなかったのは、自分の使い方に合う場面が、思ったより少なかったからです。

これ、新しい道具を試したときによく起きることだと思います。感心して、そのまま使わなくなる。でもそれは道具が悪いのではなく、自分のどの場面に合うかを、まだ見つけていないだけなのかもしれません。

私の場合は、それが「一気に伝えたいとき」だったというだけの話です。


この記事の書き方について

この記事はAIと一緒に書いています。試したこと・詰まったこと・確かめたことは、すべて私自身の体験です。それを読みやすい形にする作業をAIに手伝ってもらい、公開前に自分で事実を確認しています。

コメント

タイトルとURLをコピーしました