Skip to content

Instalar os motores

O whispa orquestra três ferramentas locais. Instala as que precisas; faz mock das restantes.

whisper.cpp (speech-to-text)

git clone https://github.com/ggml-org/whisper.cpp
cd whisper.cpp && cmake -B build && cmake --build build -j
# descarregar um modelo
./models/download-ggml-model.sh base.en

Garante que o binário whisper-cli está no PATH (ou passa binary ao WhisperCppStt). O whisper.cpp espera WAV mono a 16 kHz.

new WhisperCppStt({ model: 'models/ggml-base.en.bin' });

Ollama (LLM)

# instalar a partir de https://ollama.com, depois:
ollama pull llama3.2
ollama serve   # normalmente já a correr na :11434
new OllamaLlm({ model: 'llama3.2' });               // http://localhost:11434
new OllamaLlm({ model: 'qwen2.5', host: 'http://localhost:11434' });

Piper (text-to-speech)

# descarregar um release de https://github.com/rhasspy/piper
# e um modelo de voz (.onnx + .onnx.json)
new PiperTts({ model: 'voices/en_US-amy-medium.onnx' });

Gravação & reprodução

O whispa trata do núcleo STT→LLM→TTS. Capturar áudio do microfone e reproduzir o WAV resultante estão propositadamente fora do âmbito — usa sox/arecord/ffmpeg ou uma biblioteca de áudio da plataforma, e depois passa o caminho (ou bytes) do WAV ao pipeline.turn().

Notas de hardware

  • Modelos whisper base/small e LLMs de 1–3B correm confortavelmente num portátil moderno.
  • Num Raspberry Pi 5, prefere whisper tiny/base e um LLM pequeno quantizado.