Transkrypcje rozmów i dyktowanie, w szczegółach

Skrót jest na stronie głównej. Tu jest całość: jakie pliki powstają z rozmowy i ile trwa jej transkrypcja, jak działają etykiety mówców i podsumowania, i jak zachowuje się dyktowanie.

01 Transkrypcje rozmów

Jedna rozmowa, jeden folder zwykłych plików.

Włącz nagrywanie, a Saykeep nagra Twój mikrofon i to, co odtwarza Twój Mac, prosto z macOS: Zoom, Meet, Teams, huddle w Slacku, karta przeglądarki. Żaden bot nie dołącza do rozmowy i nie instalujesz sterownika audio. Po rozmowie dostajesz transkrypcję z podziałem na mówców, jako zwykłe pliki.

Jedno spotkanie = jeden folder w ~/Documents/Saykeep REC
mic.opusTwój mikrofon~27 MB
system.opuswszyscy pozostali~25 MB
meeting.jsonkiedy, jak długo, które ścieżki<1 KB
transcript.jsonznaczniki czasu i mówcy~220 KB
transcript.mdotworzysz wszędzie~70 KB
summary.mdpodsumowanie — (z modelem, który podłączysz)3 KB

Demo przyspieszone. Na M5 godzina rozmowy: ~35 min z etykietami mówców, 3–7 min bez nich.

Rozmiary dla godziny rozmowy, z prawdziwych nagrań. Dźwięk Opus (VLC, IINA albo dowolny odtwarzacz obsługujący Opus), JSON, Markdown — otworzysz je bez Saykeep, bez żadnego eksportu. Wolisz same transkrypcje? Jedno ustawienie kasuje dźwięk, gdy tylko transkrypcja jest zapisana.

Po zakończeniu rozmowy Saykeep tworzy transkrypcję w tle

Około 35 minut na godzinę spotkania z etykietami mówców, które są domyślnie włączone, na M5, na którym mierzyliśmy; około 3–7 minut, gdy je wyłączysz (Settings ▸ Transcription ▸ Speaker labels). Starsze Maki są wolniejsze i jeszcze ich nie zmierzyliśmy.

Oszacowane na podstawie prawdziwych nagrań o długości 10–17 minut. Sama transkrypcja działa na GPU Twojego Maca; etykietowanie mówców działa na CPU i kończy się przed zapisaniem transkrypcji, dlatego to ono wyznacza czas oczekiwania.

Panel Saykeep na pasku menu w trakcie rozmowy: Recording meeting (nagrywanie spotkania), 12:34, ścieżki MIC i SYSTEM z napisem writing, przycisk Stop meeting ze skrótem klawiszowym i folder, do którego trafia nagranie.
Panel pod ikoną na pasku menu w trakcie rozmowy: obie ścieżki się zapisują, jest przycisk Stop meeting i folder, do którego trafia nagranie.

Nagrywania nie da się ukryć

Gdy Saykeep nagrywa spotkanie, ikona na pasku menu pokazuje to przez cały czas i żadne ustawienie tego nie wyłączy — automatyczny test sprawdza każde ustawienie, żeby to się nie zmieniło. Przed pierwszym nagraniem spotkania krótki komunikat przypomina, że nagrywanie może wymagać zgody każdego uczestnika, i wymienia kraje i stany, w których trzeba uważać. Wskaźnik widać tylko na Twoim ekranie: Saykeep nie wysyła do rozmowy niczego, więc uprzedzenie pozostałych to Twoja sprawa.

Jedno zdanie, które działa, na początek rozmowy

„Nagrywam tę rozmowę do swoich notatek, na moim komputerze — czy to w porządku?”

Czy nagrywanie rozmów jest legalne? →

Nagrań nie musisz przechowywać

Zachowaj dźwięk (domyślnie), pozwól Saykeep skasować go po zapisaniu transkrypcji spotkania albo niech pyta Cię za każdym razem, gdy zatrzymasz spotkanie: Settings ▸ Privacy & Storage ▸ Recordings. Dźwięk jest kasowany dopiero wtedy, gdy transkrypcja już istnieje; transkrypcje i podsumowania nie są nigdy kasowane automatycznie.

02 Etykiety mówców

Kto co powiedział — etykiety powstają na Twoim Macu.

Etykiety mówców są domyślnie włączone. Za pierwszym razem Saykeep pobiera jeden niewielki model (około 30 MB) z models.saykeep.app, bez konta i bez tokenu; potem etykietowanie działa bez sieci. To ono zajmuje większość czasu: wyłącz je w Settings ▸ Transcription ▸ Speaker labels, a godzina rozmowy zajmie około 3–7 minut zamiast około 35, na M5, na którym mierzyliśmy.

W oknie Recordings kliknij Speakers… przy spotkaniu: przy każdym głosie są dwa przykładowe cytaty i pole na imię. Zmień „Speaker 1” na prawdziwe imię, a Save names zapisze transkrypcję tego spotkania na nowo, już z tym imieniem. Głosy z Twojego mikrofonu są oznaczone jako „You”; na spotkaniu w jednym pokoju, gdzie Twój mikrofon słyszy wszystkich, włącz Settings ▸ Transcription ▸ Label speakers on your microphone too.

Okno Recordings (nagrania) w Saykeep, widok Library, w trybie ciemnym: 4 nagrania w ~/Documents/Saykeep. Każda karta ma plakietki, np. ✓ Audio, ✓ Transcript, ✓ Summary, ✓ Speakers, ○ No summary, ○ Speakers off albo ○ Not transcribed, i przyciski, np. Open transcript, Summarize now, Transcribe, Speakers… i Delete.
Okno Recordings: przy każdym spotkaniu widać, co ma (dźwięk, transkrypcję, podsumowanie, mówców), a w Speakers… nadajesz głosom imiona.
03 Po rozmowie

Transkrypcja powstaje w tle, po rozmowie.

Zatrzymaj nagrywanie i wracaj do swoich spraw: Saykeep przepisuje rozmowę, oznacza mówców i, jeśli podłączysz model, pisze podsumowanie — jedno zadanie naraz, po kolei. Recordings ▸ Activity pokazuje, co właśnie robi i co czeka. Jeśli Twój model jest nieosiągalny, podsumowanie czeka i próbuje ponownie przy następnym nagraniu, po ponownym uruchomieniu albo gdy klikniesz Retry now; transkrypcja jest już zapisana.

Podsumowanie ma trzy części

Tematy · Decyzje, każda oznaczona jako podjęta (Decided) albo omawiana (Discussed) · Zadania, gdzie model ma polecenie przypisać każdemu punktowi właściciela: osobę przy mikrofonie, uczestnika wymienionego z imienia albo „Unassigned” (nieprzypisane). Tekst pisze usługa AI, którą podłączysz; bez niej podsumowanie po prostu nie powstaje.

## Topics- The beta ships once scope is locked.## Decisions- [Decided]: Lock the scope on Friday.## Action items- [Charlotte]: Write the announcement.- [Sebastian]: Have the setup guide ready by Friday.
Okno Recordings w Saykeep, widok Activity, w trybie ciemnym: 3 jobs · 1 running · 1 waiting · 1 deferred (3 zadania: 1 w toku, 1 czeka, 1 odłożone). Zadanie Summary oznaczone jako Waiting, bo nie udało się połączyć z serwerem modelu, z napisem „The transcript is saved — this meeting is not lost.” i przyciskami Retry now i Remove; zadanie Transcript oznaczone jako Running, Transcribing, z paskiem postępu; trzecie zadanie oznaczone jako Deferred (2/3).
Recordings ▸ Activity: jedno zadanie naraz, po kolei. Podsumowanie, którego model był nieosiągalny, czeka, a jego transkrypcja jest już zapisana.
04 Podsumowania

Podsumowania pisze model, który podłączysz.

Saykeep nie uruchamia własnego modelu językowego; do podsumowań wskazujesz mu model. Z darmowym modelem na Twoim Macu, w LM Studio albo Ollama, podsumowanie też powstaje na Twoim Macu. Z własnym kluczem API do usługi zgodnej z API OpenAI do tego dostawcy trafia tekst transkrypcji (a jeśli je wpiszesz, także Twoje imię i notatka „o Tobie”), a dźwięk nigdy.

Settings ▸ Summaries & AI pyta o adres serwera, nazwę modelu i, jeśli usługa tego wymaga, klucz API, który trafia do pęku kluczy Twojego Maca. Przycisk Test sprawdza, czy serwer odpowiada. Dopóki adres nie jest ustawiony, podsumowania są wyłączone.

ChatGPT Plus nie daje dostępu do API, więc nie da się go tu podłączyć. Bez modelu i tak dostajesz pełną transkrypcję z etykietami mówców, a Summarize now w oknie Recordings napisze podsumowanie później, gdy podłączysz model.

Ustawienia Saykeep, sekcja Summaries & AI, w trybie ciemnym: włączony przełącznik Summarise meetings automatically (podsumowuj spotkania automatycznie) i pole Endpoint address (adres serwera) z wpisanym http://127.0.0.1:8080/v1, obok napis Not tested i przycisk Test.
Podłączenie modelu to formularz, nie terminal — pola są na początku puste. Tu wpisano adres serwera modelu na tym samym Macu.
05 Dyktowanie

Przytrzymaj klawisz, mów, puść.

Przytrzymaj wybrany klawisz i mów. Mniej więcej sekundę po tym, jak go puścisz (gdy model jest już w pamięci), tekst jest w schowku, gotowy do wklejenia w dowolnej aplikacji. Wybierz Settings ▸ Privacy & Storage ▸ Dictated text ▸ „Insert it where my cursor is” (wstaw tam, gdzie jest kursor), a Saykeep wklei go tam, gdzie właśnie piszesz.

Słucha tylko Twojego mikrofonu i zachowuje tylko tekst — nie powstaje żaden plik dźwiękowy (opcja diagnostyczna, która zachowuje 20 ostatnich nagrań, jest domyślnie wyłączona). Dyktowanie nigdy nie włącza nagrywania dźwięku systemowego.

Własny słownik (zwykły plik tekstowy na Twoim Macu, z nazwiskami i fachowymi terminami, których używasz) poprawia ich pisownię w podyktowanym tekście i w tym, co czyta model piszący podsumowanie, a w trakcie transkrypcji podsuwa tę samą listę modelowi Whisper jako podpowiedź. Zapisana transkrypcja spotkania to dokładnie to, co model usłyszał.

Konfiguracja Saykeep, krok 8 z 8: „Try it — hold your push-to-talk key” (wypróbuj — przytrzymaj klawisz push-to-talk), z przepisanym zdaniem i plakietkami 0.9 s, large-v3-turbo, mlx · Apple GPU, You're all set.
Konfiguracja kończy się testem na żywo: przytrzymaj klawisz, powiedz coś i zobacz tekst, model i silnik, na którym to poszło. (Zrzut poglądowy; liczba to zmierzona mediana.)
0,89 s
mediana czasu dekodowania, model już w pamięci

Czas rozpoznania dyktowania do 30 sekund, na samym Macu, gdy model jest już w pamięci: mediana 0,89 s ze 101 dyktowań z logów autora, na jednym Macu z Apple M5 (32 GB), Whisper large-v3-turbo na GPU — najszybsze 0,6 s, najwolniejsze 10,5 s, mierzone przed wklejeniem tekstu. Dłuższe dyktowania trwają proporcjonalnie dłużej; limitu nie ma. Na Macu z małą ilością wolnej pamięci pierwsze dyktowanie po dłuższej przerwie trwało kilka sekund dłużej, bo macOS ładował model z powrotem; od wersji 0.3.7 to ładowanie rusza w chwili naciśnięcia klawisza (jeszcze nie mierzyliśmy tego ponownie).

5,4 %
słów błędnie po polsku, mowa czytana — zmierzone

Domyślne modele na próbce 100 zdań z publicznego zbioru testowego FLEURS dla każdego z języków (mowa czytana, nie nagranie ze spotkania), przepisane na jednym Macu z Apple M5 na ustawieniach domyślnych: mniej więcej jedno słowo na dwadzieścia błędnie, w obu językach (po polsku 5,4 % z modelem do dyktowania). Każdy model potyka się na nazwiskach i fachowych terminach; właśnie do tego jest własny słownik.

large-v3-turbo
tak nazywa się model do dyktowania

Whisper large-v3-turbo do dyktowania i Whisper large-v3 do spotkań — oba działają na GPU Twojego Maca przez mlx-whisper. Dyktowanie to tekst prosto z modelu plus poprawki z Twojego słownika: z interpunkcją, bez dodatkowego przepisywania i bez chmury. Język jest wykrywany osobno dla każdego nagrania, chyba że wskażesz swój w Settings ▸ Transcription ▸ Spoken language; zmierzyliśmy polski i angielski. Jeśli wolisz szybkość od dokładności, wybierz tam mniejszy model.

Pobierz darmową wersję próbną Kup — $39 30 dni · pełne funkcje · bez karty · bez konta · macOS 14.2+ (Apple Silicon)