Modele lokalne

Lokalne modele transkrypcji i podsumowań, jasne granice.

HushMemo oddziela modele zamiany mowy na tekst od modeli podsumowujących. Modele transkrypcji przekształcają dźwięk w tekst; modele podsumowań przekształcają sprawdzone transkrypcje w notatki, zadania do wykonania, e-maile i szablony.

Transkrypcja

Modele zamiany mowy na tekst

Wybierz model transkrypcji w oparciu o pamięć, szybkość i dokładność. Mniejsze modele są szybsze; większe modele radzą sobie z bardziej złożonymi nagraniami z lepszymi wynikami.

Najszybsza transkrypcja

Whisper Tiny

Mały model zamiany mowy na tekst do szybkich wersji roboczych i krótkich notatek głosowych.

Rozmiar~75 MB
JęzykiWiele języków
PrędkośćNajszybszy
PobierzRęczny

Najlepsze dla: Szybkie przemyślenia, krótkie przypomnienia, wstępne wersje robocze i urządzenia z ograniczoną pamięcią.

Szybki i kompaktowy, ale mniej dokładny przy hałasie, różnych akcentach, długich spotkaniach i specjalistycznym słownictwie.

Zrównoważona transkrypcja

Whisper Base

Zrównoważony lokalny model transkrypcji do codziennych nagrań.

Rozmiar~142 MB
JęzykiWiele języków
PrędkośćSzybki
PobierzAutomatyczny

Najlepsze dla: Spotkania, rozmowy telefoniczne, wykłady, wywiady i notatki głosowe, w których szybkość nadal ma znaczenie.

Praktyczne ustawienie domyślne po pobraniu. Ważne transkrypcje należy jeszcze sprawdzić przed podsumowaniem lub udostępnieniem.

Większa dokładność

Whisper Small

Dokładniejszy lokalny model transkrypcji przeznaczony do dłuższych nagrań i dźwięku gorszej jakości.

Rozmiar~466 MB
JęzykiWiele języków
PrędkośćWolniejszy
PobierzRęczny

Najlepsze dla: Dłuższe spotkania, wykłady, wywiady, nagrania z wieloma rozmówcami i materiały zawierające więcej szczegółów.

Wymaga więcej miejsca i czasu na przetwarzanie. Długie nagrania mogą nadal wymagać przeglądania sekcja po sekcji.

Podsumowania

Modele podsumowujące i szablonowe

Po transkrypcji lokalne modele porządkują sprawdzony tekst w ustrukturyzowane materiały, takie jak notatki ze spotkań, zadania, e-maile i notatki do nauki.

Domyślnie zalecany

Gemma 3 1B

Zrównoważony lokalny model podsumowujący codzienne notatki.

Rozmiar529 MB
Kontekst2,048 tokens
Czas wykonaniaPreferowane GPU
PobierzAutomatyczny

Najlepsze dla: Spotkania, szybkie podsumowania, wyodrębnianie TODO oraz krótkie i średnie transkrypcje.

Po pobraniu działa lokalnie. Długie nagrania mogą wymagać krótszych podsumowań lub przeglądania fragmentami.

Polecany do języka chińskiego

Qwen 2.5 1.5B

Wysokiej jakości chińskie streszczenia z większym oknem kontekstowym.

Rozmiar1.49 GB
Kontekst4,096 tokens
Czas wykonaniaPreferowane CPU
PobierzRęczny

Najlepsze dla: Chińskie spotkania, notatki konsultacyjne i szablony o większej strukturze.

Opcjonalne pobieranie ręczne. Większy rozmiar pliku oznacza więcej miejsca i dłuższy czas przetwarzania.

Wysoka jakość

Gemma 4 E2B

Opcjonalny model wysokiej jakości do dłuższego kontekstu i złożonych szablonów.

Rozmiar2.41 GB
Kontekst8,192 tokens
Czas wykonaniaPreferowane GPU
PobierzRęczny

Najlepsze dla: Dłuższe transkrypcje, głębsza analiza mowy i szablony składające się z wielu sekcji.

Opcjonalne pobieranie ręczne. Może być wolniejszy i powinien być używany na urządzeniach z wystarczającą ilością wolnego miejsca i RAM.