Превращение аудио (голосовых, звонков, лекций) в текст. Бесплатно через Groq Whisper, для diarization — Deepgram.
Groq Whisper Large-v3 (бесплатно) — для 95% случаев. Deepgram Nova-2 (платно) — только если нужен diarization (разделение спикеров).
В ~/.env положи:
GROQ_API_KEY=gsk_xxxxxxxxxxxxxxxx # получи бесплатно: console.groq.com → API Keys DEEPGRAM_API_KEY=xxxxxx # опционально, для diarization: console.deepgram.com
Groq бесплатно, rate-limit 30 req/min — для голосовых хватает с запасом.
curl -s "https://api.groq.com/openai/v1/audio/transcriptions" \ -H "Authorization: Bearer $GROQ_API_KEY" \ -F "model=whisper-large-v3" \ -F "file=@voice.ogg" \ -F "response_format=json" \ -F "language=ru"
Возвращает JSON: {"text": "..."}. Время — ~1 сек на минуту аудио.
curl -s "https://api.deepgram.com/v1/listen?model=nova-2&language=ru&diarize=true&punctuate=true&smart_format=true" \ -H "Authorization: Token $DEEPGRAM_API_KEY" \ -H "Content-Type: audio/ogg" \ --data-binary @voice.ogg
JSON-результат содержит channels[0].alternatives[0].words[] с полем speaker (0, 1, 2…) для каждого слова.
ffmpeg -i video.mp4 -vn audio.ogg сначалаffmpeg -ss 0 -t 1200 -c copy chunk1.oggWhisper.cpp локально на Mac/Linux:
brew install whisper-cpp whisper-cli -m ggml-large-v3.bin -l ru voice.ogg
Минусы: 5-10 мин на час аудио (vs 30 сек у Groq), нужен ~3GB модели на диске. Плюсы: privacy, нет интернета.
Связанные skills: data-intake-protocol (как передать результат обратно в DEMI). Версия 1.0 · 2026-04-24.