Ingeniería de Prompts para Voz: Cómo Evitar que los Bots Alucinen en Llamadas en Vivo

· Manuel · 10 min read · Innovación

Si un bot de texto en un sitio web alucina y da un correo incorrecto, no pasa mucho. Si un agente de voz en una llamada en vivo le promete a un prospecto, "Garantizamos un retorno de inversión de 500% o le devolvemos sus $100k", tienes una demanda legal catastrófica.

Escribir prompts (indicaciones) para Voz IA requiere un enfoque adversario estricto de "Defensa en Profundidad". Así es como en GSD 500 mantenemos a los bots precisos y sin alucinaciones.

1. La Muerte del Prompt en "Párrafos"

Los desarrolladores novatos escriben novelas en sus instrucciones: "Eres un vendedor amigable. Vende el producto. No mientas". Los LLMs olvidan esta estructura.

Usamos marcado XML y lógica booleana estricta. Las etiquetas XML (e.g. \`\`) obligan al LLM a categorizar estructuralmente sus límites operativos.

2. Restricciones Negativas Fuertes

Los modelos de IA como GPT-4o están diseñados para ser hiper-complacientes. Si el cliente los presiona, su instinto es estar de acuerdo.

Implementamos Restricciones Negativas fuertes al final del prompt:

  • NUNCA invente un precio.
  • NUNCA prometa un ROI específico.
  • SI hace una pregunta técnica que no está en la base de conocimientos, DEBE decir: "Buena pregunta, dejaré que nuestro gerente humano responda eso en la reunión."
  • 3. Manejadores de Estado Condicional

    Usamos bloques de lógica IF/THEN (SI/ENTONCES). SI el usuario insulta: ENTONCES responda "Disculpe la molestia" y EJECUTE la función de colgar la llamada.

    4. Reescribir para una Cadencia Hablada

    Los LLM escriben como la Wikipedia. Eso suena súper falso al pasarlo a audio y ser hablado. Para sonar natural, incluimos reglas lingüísticas:
  • Limita la respuesta a no más de 25 palabras.
  • Usa muletillas conversacionales (Ej: "Claro", "Entiendo", "Totalmente").
  • Haz una sola y única pregunta al finalizar cada turno para ceder la palabra.
  • 5. Auditoría con un Agente en las Sombras

    Incluso con el mejor prompt, ejecutamos un "Agente de Sombras". Mientras el bot principal habla, enviamos en secreto el texto de la llamada a un segundo modelo de IA más pequeño y ultrarrápido (Claude Haiku). Su único trabajo es auditar el cumplimiento. Si el bot principal dice una mentira o alucina, esta sombra lo detecta y corta la llamada o fuerza una disculpa.

    Controlar la creatividad de la Voz IA es poner el cerebro creativo en una caja de titanio para dejarlo maniobrar de manera segura.