type: session
tags: [hermes, voice, skills, upgrade, stt, tts]
created: 2026-07-27
updated: 2026-07-27
Sessão — Sistema de Voz + Skills — 27/jul/2026
Channel
Discord #unm-mk1-update (thread 1531278338981630063)
Resumo
Rocha Sales pediu para aprimorar o Ultron — adicionar comando por voz, proatividade, skills novas (design moderno, organização de vault) e memória persistente.
Decisões Tomadas
1. Fish.Audio Jarvis: API key existe (97407ed00fb2430e9aa9c95022071b12) mas retorna HTTP 402 — requer créditos API (diferente dos créditos da plataforma). Funciona via browser mas não via API direta.
2. Whisper STT: Instalado com sucesso (small model, ~244MB). Testado e funcionando — transcrição em pt-BR perfeita.
3. Edge TTS: AntonioNeural (pt-BR) e DuarteNeural (pt-PT) funcionando sem API key.
4. FFmpeg: Disponível em /usr/bin/ffmpeg v4.4.2.
5. Skills criadas: 6 novas skills implementadas.
Skills Criadas
| Skill | Path | Descrição |
| ------- | ------ | ----------- |
voice-command-stt | skills/voice/voice-command-stt/ | Whisper STT — transcrever áudio→texto |
obsidian-context-keeper | skills/system/obsidian-context-keeper/ | Protocolo de contexto entre sessões |
design-modern | skills/design/design-modern/ | Paletas, CSS, tipografia, componentes modernos |
system-profiler | skills/system/system-profiler/ | Health check do sistema Ultron |
vault-organizer | skills/system/vault-organizer/ | Organização e limpeza automática do vault |
ultron-proactivity | skills/system/ultron-proactivity/ | Sistema proativo — alertas e iniciativas |
Pendências
- - Fish.Audio API precisa de créditos para usar Jarvis via API
- - Integrar Whisper STT no fluxo Discord (receber audio → transcrever → processar → responder)
- - Configurar cron jobs de health check e vault organization
- - Testar comando de voz end-to-end (receber audio no Discord → responder com TTS)
- - Rocha Sales vai testar Whisper com mensagens de voz reais no Discord
- - Se funcionar bem, configurar pipeline completo: voz→texto→processamento→áudio resposta