Ingeniería de Prompts para Voz: Cómo Evitar que los Bots Alucinen en Llamadas en Vivo
· Manuel · 10 min read · Innovación
Si un bot de texto en un sitio web alucina y da un correo incorrecto, no pasa mucho. Si un agente de voz en una llamada en vivo le promete a un prospecto, "Garantizamos un retorno de inversión de 500% o le devolvemos sus $100k", tienes una demanda legal catastrófica.
Escribir prompts (indicaciones) para Voz IA requiere un enfoque adversario estricto de "Defensa en Profundidad". Así es como en GSD 500 mantenemos a los bots precisos y sin alucinaciones.
1. La Muerte del Prompt en "Párrafos"
Los desarrolladores novatos escriben novelas en sus instrucciones: "Eres un vendedor amigable. Vende el producto. No mientas". Los LLMs olvidan esta estructura.Usamos marcado XML y lógica booleana estricta. Las etiquetas XML (e.g. \`
2. Restricciones Negativas Fuertes
Los modelos de IA como GPT-4o están diseñados para ser hiper-complacientes. Si el cliente los presiona, su instinto es estar de acuerdo.Implementamos Restricciones Negativas fuertes al final del prompt:
3. Manejadores de Estado Condicional
Usamos bloques de lógica IF/THEN (SI/ENTONCES). SI el usuario insulta: ENTONCES responda "Disculpe la molestia" y EJECUTE la función de colgar la llamada.4. Reescribir para una Cadencia Hablada
Los LLM escriben como la Wikipedia. Eso suena súper falso al pasarlo a audio y ser hablado. Para sonar natural, incluimos reglas lingüísticas:5. Auditoría con un Agente en las Sombras
Incluso con el mejor prompt, ejecutamos un "Agente de Sombras". Mientras el bot principal habla, enviamos en secreto el texto de la llamada a un segundo modelo de IA más pequeño y ultrarrápido (Claude Haiku). Su único trabajo es auditar el cumplimiento. Si el bot principal dice una mentira o alucina, esta sombra lo detecta y corta la llamada o fuerza una disculpa.Controlar la creatividad de la Voz IA es poner el cerebro creativo en una caja de titanio para dejarlo maniobrar de manera segura.