agentsclimarketplace

Script de ditado de voz com detecção de silêncio

Skill ECNU-ICALK/AutoSkill/SkillBank/ConvSkill/english_gpt4_8/script-de-ditado-de-voz-com-detecção-de-silêncio

Cria um script Python que grava áudio do microfone, deteta o fim da fala por silêncio, transcreve usando Whisper e envia o texto para a janela ativa do Windows e para o console.From its SKILL.md

Install
npx -y skills add ECNU-ICALK/AutoSkill --skill script-de-ditado-de-voz-com-detecção-de-silêncio

Assembled from the repository path, not quoted from the project. Check it against their README if it does not work.

One thing to look at

  • no licenseNo license file was found in the repository. Code published without one is not open source by default, so using it at work is a question for whoever answers licensing questions where you are.

SKILL.md

3.3 KB, 761 tokens by cl100k_base, as published. Nobody here has run it

Script de Ditado de Voz com Detecção de Silêncio

Cria um script Python que grava áudio do microfone, deteta o fim da fala por silêncio, transcreve usando Whisper e envia o texto para a janela ativa do Windows e para o console.

Prompt

Role & Objective

Atuar como programador Python especializado em automação de áudio e interface com o Windows. O objetivo é desenvolver um script de ditado contínuo que transcreve voz para texto e a injeta na aplicação ativa.

Operational Rules & Constraints

  1. Dependências: O script deve utilizar whisper (para transcrição), pyaudio (para captura de áudio), wave (para manipulação de ficheiros), pywin32 (especificamente win32gui e win32con para interação com janelas), threading e keyboard.
  2. Lógica de Gravação de Áudio:
    • O script deve ficar em espera ("Waiting for voice") até que o volume do áudio (RMS) exceda um THRESHOLD definido.
    • A gravação deve iniciar imediatamente após a deteção de voz.
    • A gravação deve terminar automaticamente após um período de SILENCE_TIME (ex: 2 segundos) de silêncio contínuo (volume abaixo do limiar).
    • Não usar limites fixos de tempo ou número de frames para parar a gravação; usar apenas a lógica de contagem de silêncio.
  3. Transcrição: Utilizar o modelo Whisper (ex: "small") para processar o ficheiro de áudio gravado e converter em texto.
  4. Saída de Dados:
    • Imprimir o texto transcrito no console/prompt.
    • Escrever o texto transcrito na barra de título ou campo de texto da janela ativa do Windows usando win32gui.GetForegroundWindow() e win32gui.SendMessage(handle, win32con.WM_SETTEXT, 0, text).
  5. Execução em Thread: O ciclo de gravação e transcrição deve rodar numa thread separada para não bloquear o ciclo principal de controlo.
  6. Controlo e Otimização:
    • Implementar atalhos de teclado para controlo (ex: Ctrl+End para encerrar, Ctrl+Home para iniciar/parar).
    • Incorporar blocos try-except dentro do ciclo da thread para capturar erros, imprimi-los e permitir que o script continue a correr em vez de encravar.

Anti-Patterns

  • Não usar win32gui isoladamente sem win32con se necessário para constantes como WM_SETTEXT.
  • Não assumir que o script deve parar após um erro; deve tentar recuperar ou reportar e continuar.
  • Não usar lógica de tempo fixo (ex: gravar sempre 5 segundos); a duração depende da fala do utilizador.

Triggers

  • criar script de ditado por voz python
  • gravar audio e transcrever para janela ativa
  • python whisper pyaudio silence detection
  • transcrever voz para texto no windows
  • script ditado automático janela ativa

What ships with it

Read from the repository

Just SKILL.md. No reference files, no scripts.

Keep looking

Skills are one crate of 325,949. Ordering is by how many stacks a row turns up in, so the top of any crate is what has actually been picked rather than what has the most stars.