Instalar os motores¶
O whispa orquestra três ferramentas locais. Instala as que precisas; faz mock das restantes.
whisper.cpp (speech-to-text)¶
git clone https://github.com/ggml-org/whisper.cpp
cd whisper.cpp && cmake -B build && cmake --build build -j
# descarregar um modelo
./models/download-ggml-model.sh base.en
Garante que o binário whisper-cli está no PATH (ou passa binary ao
WhisperCppStt). O whisper.cpp espera WAV mono a 16 kHz.
Ollama (LLM)¶
# instalar a partir de https://ollama.com, depois:
ollama pull llama3.2
ollama serve # normalmente já a correr na :11434
new OllamaLlm({ model: 'llama3.2' }); // http://localhost:11434
new OllamaLlm({ model: 'qwen2.5', host: 'http://localhost:11434' });
Piper (text-to-speech)¶
# descarregar um release de https://github.com/rhasspy/piper
# e um modelo de voz (.onnx + .onnx.json)
Gravação & reprodução¶
O whispa trata do núcleo STT→LLM→TTS. Capturar áudio do microfone e reproduzir o WAV
resultante estão propositadamente fora do âmbito — usa sox/arecord/ffmpeg ou uma
biblioteca de áudio da plataforma, e depois passa o caminho (ou bytes) do WAV ao
pipeline.turn().
Notas de hardware¶
- Modelos whisper
base/smalle LLMs de 1–3B correm confortavelmente num portátil moderno. - Num Raspberry Pi 5, prefere whisper
tiny/basee um LLM pequeno quantizado.