Macで快適な音声入力を求めて、VoiceInkにたどり着いた

Digital Life

Mac標準の音声入力を使っているうちに、だんだんと物足りなさを感じるようになってきました。そこで4つのサードパーティー製の音声入力アプリを比較した結果、最終的に「VoiceInk」を使い続けることにしました。

精度も高くて専門用語もOK

macOS標準の音声入力は、しゃべった端から文字になっていく心地よさと安心感があるものの、専門用語などが正しく入力できないのが残念な点でした。特に私はITやデジタル関連の用語、商品名などを入力する機会が多くて、その都度手作業で訂正するのが億劫になっていました。そこで、サードパーティ製の音声入力アプリをいくつか試して、自分にピッタリのものを探してみることにしました。

「MacWhisper」「superwhisper」「Aqua Voice」「VoiceInk」の4つを試しましたが、最終的に使い続けようと思ったのが「VoiceInk」でした。音声認識の精度は高いし、ボキャブラリーも豊富で専門用語も正確に入力できます。もし正確に変換できない言葉が出てきても、辞書に登録すれば次からは正確に入力できるようになります。 これがmacOS標準にはない圧倒的な長所です。

また、ほかのアプリと比べて処理速度が速い点や、29ドルの買い切りで使える点も決め手になりました。 

VoiceInkでは、音声認識に使うAIモデルを自由に選べるようになっていますが、最初はどれがいいのか迷いました。選ぶモデルによっては、期待したような結果にならず、がっかりすることもあります。いろいろ試した中で、もっとも精度が高いと感じたのが「Large v3 Turbo(Quantized)」でした。

このモデルの場合、短い文を処理しようとすると、なぜか英語に翻訳されてしまうことがあります。ただ、ある程度長く話してから一気に処理させることで、この問題を回避できるとわかりました。あるいは、「Cohere Transcribe」モデルを使えば、短い文でも正確に処理できます。処理速度や処理の結果は選ぶモデルによって変わりますが、この2つはだいたい同じレベルです。両方を試して好みのものを選ぶのがいいと思います。

VoiceInkを本格的に使い始めて2週間が過ぎましたが、もはや手放せない存在になっています。フリーランスなどで自宅で仕事をしていて、日常的に音声入力ができる人には非常におすすめです。 

VoiceInkの始め方

ここから先は、実際にVoiceInkをダウンロードした方に向けて、最初の設定や一歩進んだ活用方法などをご紹介していきます。これからVoiceInkを使おうとしている皆さんのお役に立てば幸いです。 

最初にAI Modelを選択します。サイドバーの[AI Models]を選んで、モデルをダウンロードしましょう。私のおすすめは「Large v3 Turbo(Quantized)」です。「Quantized」というのは、AIモデルを軽量化する手法の1つなのだそう。「Large v3 Turbo」よりもデータ量が少なくなっています。
ダウンロードが終わったら、モデルを割り当てます。サイドバーから[Models]を選びましょう。最初は「Default」という項目があると思います。
「Default」をクリックすると、サイドパネルが開きます。[Transcription]欄の[Model]で、先ほどダウンロードした「Large v3 Turbo(Quantized)」を指定します。
その下にある[Language]は[Auto-detect](自動認識)でもいいのですが、[Japanese]を指定したほうが誤認識が減ると思います。[Japanese]のすぐ下には、[Javanese](ジャワ語)があるので間違えないよう注意。設定したら[Save Change]ボタンを押すと、パネルが閉じます。 
次に[Setting]から、呼び出すためのキーを設定します。一番上にある[Primary Shortcut]でキーを設定しましょう。[control]キーや[option]キーなどは左右を区別してくれます。 
その隣にあるプルダウンメニューでは、キーの操作方法を設定します。[Toggle]は、一度押すと起動し、もう一度押すと終了します。[Push to Talk]は、押しっぱなしにしている間認識し、キーを離すと終了します。 [Hybrid]は、その両方の操作に対応します。使用頻度が多い場合や、長文を一気にしゃべりたい場合には[Toggle]のほうが使いやすいと思います。最初にやっておくべき設定は、最低限これだけでOKです。
設定ウィンドウを閉じて、実際に使ってみましょう。好きなアプリ上で、先ほど設定したキーボードショートカットを押すと、画面の中央下部にこのようなインジケーターが表示されます。マイクに向かって話しましょう。
少し待つと、カーソルがあった位置にテキストが挿入されます。 話す文が短いと、そもそも日本語として認識されなかったり、日本語として認識されているはずなのになぜか英語に翻訳されて出力されてしまいます。なるべく長い文を一気に話すのがコツです。

一歩進んだ設定と使い方

まず覚えておきたいのが、辞書登録です。サイドバーの[Dictionary]を開き、正しく変換してほしい言葉を登録しましょう。[Word Replacements]タブの上部にある入力欄で、左側に「読み」、右側に「変換してほしい文字列」を入力し、[return]キーを押すと登録されます。 [Vocabrary]タブでも単語を登録できますが、日本語の場合は[Word Replacements]のほうが確実な気がします。 
次に覚えておきたいのが、Historyです。このアプリでは過去の入力履歴が保存されますが、音声データまで保存するため、放っておくとMacの空き容量を圧迫していきます。 自動的に削除するよう設定しておきましょう。
[歯車]ボタンを押してサイドパネルを開き、[Auto-delete Audio Files]のスイッチをオンにします。[Keep Audio For](オーディオを保持する期間)は[1 day]にしています。
また、音声入力を開始したときに、再生中の音楽などをミュートする設定もあります。私は仕事中、「ミュージック」アプリで音楽を流しているので、この設定があるのは非常にありがたいです。[Audio]ボタンからオーディオ設定画面を開き、[Mute Audio While Recording]と[Pause Media While Recording]のスイッチをそれぞれオンにします。
あとは、複数のモデルを使い分けるのもおすすめ。モデルごとに、呼び出すためのキーボードショートカットを設定できます。私は、普段は「Large v3 Turbo(Quantized)」を使い、それでうまく変換できないときには「Cohere Transcribe」を別のショートカットで起動するという使い方をしています。
このほか、私はクリップボードの設定を変更しています。このアプリでは、音声入力の結果であるテキストをクリップボードに格納して、それをペーストする仕組みになっています。 内部的には、次のような流れで処理されているのだと思います。1.元々クリップボードに入っている情報をアプリ側で保管 2.音声入力 3.文字起こしの結果をクリップボードに格納 4.自動でペースト 5.アプリ側で保管していたクリップボード情報を再びクリップボードに戻す。デフォルトだと、4→5の工程に2秒間の空き時間が設定されているのですが、私はこれを[500ms]に変更しています。
タイトルとURLをコピーしました