Skrót jest na stronie głównej. Tu jest całość: jakie pliki powstają z rozmowy i ile trwa jej transkrypcja, jak działają etykiety mówców i podsumowania, i jak zachowuje się dyktowanie.
Włącz nagrywanie, a Saykeep nagra Twój mikrofon i to, co odtwarza Twój Mac, prosto z macOS: Zoom, Meet, Teams, huddle w Slacku, karta przeglądarki. Żaden bot nie dołącza do rozmowy i nie instalujesz sterownika audio. Po rozmowie dostajesz transkrypcję z podziałem na mówców, jako zwykłe pliki.
Demo przyspieszone. Na M5 godzina rozmowy: ~35 min z etykietami mówców, 3–7 min bez nich.
[00:04] You: Scope locks Friday, then the beta ships. Charlotte, can you write the announcement? Sebastian, the setup guide?[00:11] Speaker 1:Charlotte: Sure, I'll write it.[00:19] Speaker 2:Sebastian: Ready by Friday.
przykładowe spotkanie · mówców nazywasz Ty
## Topics- The beta ships once scope is locked.## Decisions- [Decided]: Lock the scope on Friday.## Action items- [Charlotte]: Write the announcement.- [Sebastian]: Have the setup guide ready by Friday.
Około 35 minut na godzinę spotkania z etykietami mówców, które są domyślnie włączone, na M5, na którym mierzyliśmy; około 3–7 minut, gdy je wyłączysz (Settings ▸ Transcription ▸ Speaker labels). Starsze Maki są wolniejsze i jeszcze ich nie zmierzyliśmy.
Oszacowane na podstawie prawdziwych nagrań o długości 10–17 minut. Sama transkrypcja działa na GPU Twojego Maca; etykietowanie mówców działa na CPU i kończy się przed zapisaniem transkrypcji, dlatego to ono wyznacza czas oczekiwania.
Gdy Saykeep nagrywa spotkanie, ikona na pasku menu pokazuje to przez cały czas i żadne ustawienie tego nie wyłączy — automatyczny test sprawdza każde ustawienie, żeby to się nie zmieniło. Przed pierwszym nagraniem spotkania krótki komunikat przypomina, że nagrywanie może wymagać zgody każdego uczestnika, i wymienia kraje i stany, w których trzeba uważać. Wskaźnik widać tylko na Twoim ekranie: Saykeep nie wysyła do rozmowy niczego, więc uprzedzenie pozostałych to Twoja sprawa.
„Nagrywam tę rozmowę do swoich notatek, na moim komputerze — czy to w porządku?”
Czy nagrywanie rozmów jest legalne? →
Zachowaj dźwięk (domyślnie), pozwól Saykeep skasować go po zapisaniu transkrypcji spotkania albo niech pyta Cię za każdym razem, gdy zatrzymasz spotkanie: Settings ▸ Privacy & Storage ▸ Recordings. Dźwięk jest kasowany dopiero wtedy, gdy transkrypcja już istnieje; transkrypcje i podsumowania nie są nigdy kasowane automatycznie.
Etykiety mówców są domyślnie włączone. Za pierwszym razem Saykeep pobiera jeden niewielki model (około 30 MB) z models.saykeep.app, bez konta i bez tokenu; potem etykietowanie działa bez sieci. To ono zajmuje większość czasu: wyłącz je w Settings ▸ Transcription ▸ Speaker labels, a godzina rozmowy zajmie około 3–7 minut zamiast około 35, na M5, na którym mierzyliśmy.
W oknie Recordings kliknij Speakers… przy spotkaniu: przy każdym głosie są dwa przykładowe cytaty i pole na imię. Zmień „Speaker 1” na prawdziwe imię, a Save names zapisze transkrypcję tego spotkania na nowo, już z tym imieniem. Głosy z Twojego mikrofonu są oznaczone jako „You”; na spotkaniu w jednym pokoju, gdzie Twój mikrofon słyszy wszystkich, włącz Settings ▸ Transcription ▸ Label speakers on your microphone too.
Zatrzymaj nagrywanie i wracaj do swoich spraw: Saykeep przepisuje rozmowę, oznacza mówców i, jeśli podłączysz model, pisze podsumowanie — jedno zadanie naraz, po kolei. Recordings ▸ Activity pokazuje, co właśnie robi i co czeka. Jeśli Twój model jest nieosiągalny, podsumowanie czeka i próbuje ponownie przy następnym nagraniu, po ponownym uruchomieniu albo gdy klikniesz Retry now; transkrypcja jest już zapisana.
Tematy · Decyzje, każda oznaczona jako podjęta (Decided) albo omawiana (Discussed) · Zadania, gdzie model ma polecenie przypisać każdemu punktowi właściciela: osobę przy mikrofonie, uczestnika wymienionego z imienia albo „Unassigned” (nieprzypisane). Tekst pisze usługa AI, którą podłączysz; bez niej podsumowanie po prostu nie powstaje.
## Topics- The beta ships once scope is locked.## Decisions- [Decided]: Lock the scope on Friday.## Action items- [Charlotte]: Write the announcement.- [Sebastian]: Have the setup guide ready by Friday.
Saykeep nie uruchamia własnego modelu językowego; do podsumowań wskazujesz mu model. Z darmowym modelem na Twoim Macu, w LM Studio albo Ollama, podsumowanie też powstaje na Twoim Macu. Z własnym kluczem API do usługi zgodnej z API OpenAI do tego dostawcy trafia tekst transkrypcji (a jeśli je wpiszesz, także Twoje imię i notatka „o Tobie”), a dźwięk nigdy.
Settings ▸ Summaries & AI pyta o adres serwera, nazwę modelu i, jeśli usługa tego wymaga, klucz API, który trafia do pęku kluczy Twojego Maca. Przycisk Test sprawdza, czy serwer odpowiada. Dopóki adres nie jest ustawiony, podsumowania są wyłączone.
ChatGPT Plus nie daje dostępu do API, więc nie da się go tu podłączyć. Bez modelu i tak dostajesz pełną transkrypcję z etykietami mówców, a Summarize now w oknie Recordings napisze podsumowanie później, gdy podłączysz model.
Gdzie powstają podsumowania, w każdym położeniu przełącznika →
Przytrzymaj wybrany klawisz i mów. Mniej więcej sekundę po tym, jak go puścisz (gdy model jest już w pamięci), tekst jest w schowku, gotowy do wklejenia w dowolnej aplikacji. Wybierz Settings ▸ Privacy & Storage ▸ Dictated text ▸ „Insert it where my cursor is” (wstaw tam, gdzie jest kursor), a Saykeep wklei go tam, gdzie właśnie piszesz.
Słucha tylko Twojego mikrofonu i zachowuje tylko tekst — nie powstaje żaden plik dźwiękowy (opcja diagnostyczna, która zachowuje 20 ostatnich nagrań, jest domyślnie wyłączona). Dyktowanie nigdy nie włącza nagrywania dźwięku systemowego.
Własny słownik (zwykły plik tekstowy na Twoim Macu, z nazwiskami i fachowymi terminami, których używasz) poprawia ich pisownię w podyktowanym tekście i w tym, co czyta model piszący podsumowanie, a w trakcie transkrypcji podsuwa tę samą listę modelowi Whisper jako podpowiedź. Zapisana transkrypcja spotkania to dokładnie to, co model usłyszał.
Czas rozpoznania dyktowania do 30 sekund, na samym Macu, gdy model jest już w pamięci: mediana 0,89 s ze 101 dyktowań z logów autora, na jednym Macu z Apple M5 (32 GB), Whisper large-v3-turbo na GPU — najszybsze 0,6 s, najwolniejsze 10,5 s, mierzone przed wklejeniem tekstu. Dłuższe dyktowania trwają proporcjonalnie dłużej; limitu nie ma. Na Macu z małą ilością wolnej pamięci pierwsze dyktowanie po dłuższej przerwie trwało kilka sekund dłużej, bo macOS ładował model z powrotem; od wersji 0.3.7 to ładowanie rusza w chwili naciśnięcia klawisza (jeszcze nie mierzyliśmy tego ponownie).
Domyślne modele na próbce 100 zdań z publicznego zbioru testowego FLEURS dla każdego z języków (mowa czytana, nie nagranie ze spotkania), przepisane na jednym Macu z Apple M5 na ustawieniach domyślnych: mniej więcej jedno słowo na dwadzieścia błędnie, w obu językach (po polsku 5,4 % z modelem do dyktowania). Każdy model potyka się na nazwiskach i fachowych terminach; właśnie do tego jest własny słownik.
Whisper large-v3-turbo do dyktowania i Whisper large-v3 do spotkań — oba działają na GPU Twojego Maca przez mlx-whisper. Dyktowanie to tekst prosto z modelu plus poprawki z Twojego słownika: z interpunkcją, bez dodatkowego przepisywania i bez chmury. Język jest wykrywany osobno dla każdego nagrania, chyba że wskażesz swój w Settings ▸ Transcription ▸ Spoken language; zmierzyliśmy polski i angielski. Jeśli wolisz szybkość od dokładności, wybierz tam mniejszy model.