Skrót jest na stronie głównej. Tu jest całość — jak działa dyktowanie, co spotkanie zostawia na dysku i ile to trwa.
Przytrzymaj klawisz i mów albo przełącz na tryb „naciśnij, żeby zacząć”; klawisz wybierasz sam. Twoje słowa są w schowku mniej więcej sekundę po tym, jak skończysz. Włącz Insert at cursor (wstawianie przy kursorze), a Saykeep wklei je (⌘V) w pole, w którym właśnie piszesz — w każdej aplikacji na Macu, do której da się wkleić: w edytorze, w poczcie, w terminalu, na czacie. Właśnie do tego służy uprawnienie Dostępność. Jeśli zostaniesz przy schowku, narzędzia z historią schowka zobaczą Twoje dyktowanie jak każde inne kopiowanie.
Własny słownik — zwykły plik tekstowy z nazwiskami i fachowymi terminami, których używasz, przechowywany na Twoim Macu — poprawia ich pisownię w podyktowanym tekście i w tym, co czyta model piszący podsumowanie, a w trakcie transkrypcji podsuwa tę samą listę modelowi Whisper jako podpowiedź. Zapisana transkrypcja spotkania zostaje taka, jaką model faktycznie usłyszał.
Czas rozpoznania dyktowania do 30 sekund, na samym Macu, gdy model jest już w pamięci: mediana 0,89 s ze 101 dyktowań z logów autora, na jednym Macu z Apple M5 (32 GB), Whisper large-v3-turbo na GPU — najszybsze 0,6 s, najwolniejsze 10,5 s, mierzone przed wklejeniem tekstu. Dłuższe dyktowania trwają proporcjonalnie dłużej; limitu nie ma. Na Macu z małą ilością wolnej pamięci pierwsze dyktowanie po dłuższej przerwie trwało kilka sekund dłużej, bo macOS ładował model z powrotem; od wersji 0.3.7 to ładowanie rusza w chwili naciśnięcia klawisza (jeszcze nie mierzyliśmy tego ponownie).
Domyślne modele na próbce 100 zdań z publicznego zbioru testowego FLEURS dla każdego z języków — mowa czytana, nie nagranie ze spotkania — przepisane na Macu z Apple Silicon na ustawieniach domyślnych: mniej więcej jedno słowo na dwadzieścia błędnie, w obu językach. Każdy model potyka się na nazwiskach i fachowych terminach; właśnie do tego jest własny słownik.
Whisper large-v3-turbo do dyktowania, Whisper large-v3 do spotkań — oba działają na GPU Twojego Maca przez mlx-whisper. Dyktowanie to tekst prosto z modelu plus poprawki z Twojego słownika — z interpunkcją, ale bez żadnego dodatkowego przepisywania i bez chmury. Kilkadziesiąt języków, wykrywanych automatycznie dla każdego nagrania albo ustawionych na stałe w ustawieniach; jeśli wolisz szybkość od dokładności, wybierz tam mniejszy model.
Włącz nagrywanie, a Saykeep nagra Twój mikrofon i wszystko, co odtwarza Twój Mac — prosto z systemu dźwięku macOS. Żaden bot nie dołącza do rozmowy, nie instalujesz wirtualnego sterownika audio. Nagrywanie obejmuje cały system, więc nie ma znaczenia, która aplikacja mówi: Zoom, Meet, Teams, huddle w Slacku, karta przeglądarki. Autor codziennie nagrywa tak swoje rozmowy na Zoomie. Do spotkań macOS poprosi o dwa uprawnienia: Mikrofon i Nagrywanie dźwięku systemowego.
Na Macu, na którym mierzyliśmy (M5), godzina nagrania ze spotkania to około 3–7 minut transkrypcji i ok. 30 minut więcej na etykietowanie mówców, które działa na CPU, zanim transkrypcja zostanie zapisana — oszacowane na podstawie prawdziwych nagrań o długości 10–17 minut. Starsze Maki z Apple Silicon będą wolniejsze; jeszcze ich nie mierzyliśmy.
Tematy · Decyzje, każda oznaczona jako podjęta (Decided) albo omawiana (Discussed) · Zadania, gdzie model ma polecenie przypisać każdemu punktowi właściciela: osobę przy mikrofonie, uczestnika wymienionego z imienia albo „Unassigned” (nieprzypisane). Tekst pisze usługa AI, którą podłączysz; bez niej podsumowanie po prostu nie powstaje.
## Topics - … ## Decisions - [Decided]: … - [Discussed]: … ## Action items - [Marek]: … - [Unassigned]: …
Za pierwszym razem jedno pobranie modelu (~30 MB), potem w pełni offline. Otwórz nagranie, zmień „Speaker 1” na prawdziwe imię, a transkrypcja tego spotkania zostanie zapisana na nowo z tym imieniem. Głosy z Twojego własnego mikrofonu są oznaczone jako „You”, chyba że w ustawieniach włączysz rozpoznawanie mówców z mikrofonu.
Gdy Saykeep nagrywa spotkanie, ikona na pasku menu pokazuje to przez cały czas i żadne ustawienie tego nie wyłączy — automatyczny test sprawdza każde ustawienie, żeby tak zostało. Przed pierwszym nagraniem spotkania krótki komunikat przypomina, że nagrywanie może wymagać zgody każdego uczestnika, i wymienia kraje i stany, w których trzeba uważać. Wskaźnik widać tylko na Twoim ekranie: Saykeep nie wysyła do rozmowy niczego, więc uprzedzenie pozostałych to nadal Twoja sprawa. Czy nagrywanie jest legalne?
Zachowaj dźwięk (domyślnie), pozwól Saykeep skasować go po zapisaniu transkrypcji spotkania albo niech pyta Cię po każdym spotkaniu. Dźwięk jest kasowany wyłącznie wtedy, gdy transkrypcja już istnieje; transkrypcje i podsumowania nie są nigdy kasowane automatycznie.