Skill

audio-to-text

Превращение аудио (голосовых, звонков, лекций) в текст. Бесплатно через Groq Whisper, для diarization — Deepgram.

Когда применять

Решение в 1 предложение

Groq Whisper Large-v3 (бесплатно) — для 95% случаев. Deepgram Nova-2 (платно) — только если нужен diarization (разделение спикеров).

Setup ключа

В ~/.env положи:

GROQ_API_KEY=gsk_xxxxxxxxxxxxxxxx  # получи бесплатно: console.groq.com → API Keys
DEEPGRAM_API_KEY=xxxxxx            # опционально, для diarization: console.deepgram.com

Groq бесплатно, rate-limit 30 req/min — для голосовых хватает с запасом.

Базовое использование (Groq, бесплатно)

curl -s "https://api.groq.com/openai/v1/audio/transcriptions" \
  -H "Authorization: Bearer $GROQ_API_KEY" \
  -F "model=whisper-large-v3" \
  -F "file=@voice.ogg" \
  -F "response_format=json" \
  -F "language=ru"

Возвращает JSON: {"text": "..."}. Время — ~1 сек на минуту аудио.

Если нужен diarization (Deepgram, $0.0043/мин)

curl -s "https://api.deepgram.com/v1/listen?model=nova-2&language=ru&diarize=true&punctuate=true&smart_format=true" \
  -H "Authorization: Token $DEEPGRAM_API_KEY" \
  -H "Content-Type: audio/ogg" \
  --data-binary @voice.ogg

JSON-результат содержит channels[0].alternatives[0].words[] с полем speaker (0, 1, 2…) для каждого слова.

Поддерживаемые форматы

Ограничения

Если нужно полностью бесплатно + offline

Whisper.cpp локально на Mac/Linux:

brew install whisper-cpp
whisper-cli -m ggml-large-v3.bin -l ru voice.ogg

Минусы: 5-10 мин на час аудио (vs 30 сек у Groq), нужен ~3GB модели на диске. Плюсы: privacy, нет интернета.


Связанные skills: data-intake-protocol (как передать результат обратно в DEMI). Версия 1.0 · 2026-04-24.