ローカルモデル

ローカル文字起こしおよび要約モデル、明確な境界。

HushMemo は、音声認識モデルを要約モデルから分離します。文字起こしモデルは音声をテキストに変換します。要約モデルは、レビューされた文字起こしをメモ、TODO、メール、およびテンプレートに変換します。

文字起こし

音声認識モデル

ストレージ、速度、精度に基づいて文字起こしモデルを選択します。モデルが小さいほど高速になります。モデルが大きいほど、より複雑な記録を処理でき、より良い結果が得られます。

最速の文字起こし

Whisper Tiny

素早い下書きや短い音声メモ用の小型音声認識モデル。

サイズ~75 MB
言語多言語対応
速度最速
ダウンロードマニュアル

以下に最適:簡単な考え、短いリマインダー、下書き、およびストレージが限られているデバイス。

高速かつコンパクトですが、ノイズ、アクセント、長時間の会議、または専門分野の語彙があるため精度が低下します。

バランスの取れた文字起こし

Whisper Base

日常の録音に適したバランスのとれたローカル文字起こしモデル。

サイズ~142 MB
言語多言語対応
速度速い
ダウンロード自動

以下に最適:スピードが依然として重要な会議、電話、講義、インタビュー、音声メモ。

ダウンロード後の実質的なデフォルト。重要な文字起こしは、要約したり共有したりする前に必ず確認する必要があります。

より高い精度

Whisper Small

長くて乱雑なオーディオ向けの高精度のローカル文字起こしモデル。

サイズ~466 MB
言語多言語対応
速度遅い
ダウンロードマニュアル

以下に最適:長時間の会議、講義、インタビュー、混合講演者、より詳細な録音。

より多くのストレージと処理時間を使用します。長時間の録音の場合は、セクションごとのレビューが必要な場合があります。

概要

概要とテンプレート モデル

文字起こし後、ローカル要約モデルはレビューされたテキストを会議メモ、タスク、メール、学習メモなどの構造化された出力に整理します。

デフォルトを推奨

Gemma 3 1B

日常のメモのためのバランスのとれたローカル要約モデル。

サイズ529 MB
コンテキスト2,048 tokens
ランタイムGPU を優先
ダウンロード自動

以下に最適:会議、簡単な要約、TODO の抽出、および短期から中程度の文字起こし。

ダウンロード後にローカルで実行します。長い録画の場合は、短い要約または分割されたレビューが必要になる場合があります。

中国語が好ましい

Qwen 2.5 1.5B

より大きなコンテキスト ウィンドウを備えた高品質の中国語の概要。

サイズ1.49 GB
コンテキスト4,096 tokens
ランタイムCPU を優先
ダウンロードマニュアル

以下に最適:中国語の会議、相談ノート、およびより構造的なテンプレート。

任意で手動ダウンロードできます。ファイル サイズが大きくなると、ストレージが増え、処理時間が長くなります。

高品質

Gemma 4 E2B

より長いコンテキストや複雑なテンプレート用の高品質モデルをオプトインします。

サイズ2.41 GB
コンテキスト8,192 tokens
ランタイムGPU を優先
ダウンロードマニュアル

以下に最適:より長い文字起こし、より深い音声分析、および複数セクションのテンプレート。

任意で手動ダウンロードできます。速度が遅くなる可能性があるため、十分な空きストレージと RAM を備えたデバイスで使用する必要があります。