¿Qué son los Tests?
Los Tests son pruebas de regresión automatizadas que validan el comportamiento de tu agente. A diferencia de las Evaluaciones (que se ejecutan después de cada llamada real), los Tests se ejecutan bajo demanda en el Editor Avanzado para verificar que tu agente responde correctamente a escenarios específicos antes de desplegar cambios.Accediendo a los Tests
Los Tests están ubicados en el panel derecho del Editor Avanzado. Haz clic en la pestaña Tests (icono de portapapeles) para acceder.Tests vs Evaluaciones
Tipos de Tests
Tests de Escenario
Un test de Escenario define un flujo de conversación fijo. Especificas los mensajes exactos (usuario y agente) y una condición de éxito. El sistema evalúa si la respuesta del agente cumple tus criterios.Tests de Simulación
Un test de Simulación usa IA para simular un usuario. Defines una persona, objetivo y primer mensaje. El sistema ejecuta una conversación completa y evalúa el resultado.Funcionalidades Avanzadas de Tests
Simulación de Conversaciones en Tiempo Real
Abrir Simulador
Configurar Parámetros
- Primer mensaje: Cómo empieza el usuario simulado
- Persona: Perfil y características del usuario
- Objetivo: Meta que busca alcanzar el usuario
- Límite de turnos: Máximo de intercambios (por defecto 10)
Ejecutar Simulación
Variables Dinámicas Avanzadas
Los tests pueden usar variables de contexto que se reemplazan durante la ejecución:Testing por Lotes y Repeticiones
El sistema permite ejecutar tests múltiples veces para detectar inconsistencias:- Ejecución por lotes: Ejecuta todos los tests seleccionados en una sola operación
- Repeticiones automáticas: Configura hasta 10 repeticiones por test para validar consistencia
- Análisis estadístico: Obtén métricas de éxito/fallo a través de múltiples ejecuciones
- Ejecución Simple
- Ejecución por Lotes
Historial de Ejecuciones Detallado
La pestaña Historial proporciona análisis completos de ejecuciones anteriores:Información de Ejecución
Análisis Individual por Test
Cada ejecución muestra:- Respuesta completa del agente
- Razón de evaluación detallada
- Conversación completa (para simulaciones)
- Tiempo de respuesta
- Tokens utilizados
Acceder al Historial
Seleccionar Ejecución
Analizar Resultados
Ejecutar Acciones
- Reintentar fallidos: Re-ejecuta solo tests fallidos
- Reintentar todo: Re-ejecuta toda la suite
- Exportar resultados: Descarga reporte detallado
Integración con Copilot para Mejoras Automáticas
Análisis Inteligente de Fallos
Cuando tests fallan consistentemente, el sistema:- Analiza patrones de fallo en múltiples ejecuciones
- Identifica problemas comunes en respuestas del agente
- Genera prompts de mejora específicos para Copilot
- Sugiere modificaciones a prompts, conocimientos o acciones
Flujo de Mejora Automática
Ejecutar Suite de Tests
Detectar Fallos Consistentes
Generar Análisis Automático
Aplicar Sugerencias
Validar con Re-testing
Tipos de Sugerencias de Copilot
Crear un Test
Abrir Panel de Tests
Clic en Nuevo
Paso 1 - Nombre y Tipo
- Introduce un nombre descriptivo
- Elige Escenario (conversación fija) o Simulación (conversación dinámica)
Paso 2 - Configurar Conversación
- Primer mensaje del usuario simulado
- Persona y características del usuario
- Objetivo que busca alcanzar
Paso 3 - Criterios de Éxito
- Define la condición de éxito clara y específica
- Añade ejemplos de respuestas exitosas
- Incluye ejemplos de respuestas que deben fallar
Configurar Variables (Opcional)
Guardar y Probar
Variables de Contexto Avanzadas
- Variables del Sistema
- Variables Personalizadas
- Variables de Entrada del Agente
Configurar Variables de Contexto
Abrir Panel de Variables
{}) en el encabezado de Tests.Configurar Variables del Sistema
fecha_y_hora_actual para usar la hora actual.Añadir Variables Personalizadas
- Nombre: clave de la variable (ej.
cliente_nombre) - Valor: contenido que se inyectará (ej. “Juan Pérez”)
Validar Inyección
Ejecutar Tests Avanzado
Estrategias de Ejecución
- Ejecución Selectiva
- Ejecución Completa
- Ejecución por Lotes
- Marca casillas de tests específicos
- Útil para validar cambios puntuales
- Menor tiempo de ejecución
Configuración de Lotes
Monitoreo en Tiempo Real
Durante la ejecución observa:- Progreso de cada test con indicadores visuales
- Tiempo estimado restante
- Fallos inmediatos para detención rápida
- Uso de recursos (tokens, tiempo de respuesta)
Pestaña Historial Avanzado
Vista de Resumen
La vista principal del historial muestra:Análisis Detallado de Ejecuciones
Seleccionar Ejecución
Revisar Métricas Globales
- Tiempo promedio de respuesta
- Distribución de éxitos/fallos
- Tokens totales utilizados
- Variables de contexto aplicadas
Analizar Tests Individuales
- Respuesta completa del agente
- Evaluación paso a paso
- Conversación completa (simulaciones)
- Comparación con ejecuciones anteriores
Identificar Patrones
- Tests que fallan consistentemente
- Variaciones en respuestas
- Degradación de rendimiento
- Mejoras tras cambios
Acciones de Seguimiento
Simular Conversación Avanzada
La función Simular permite testing exploratorio sin crear tests permanentes:Configuración de Simulación
- Básica
- Avanzada
Monitoreo de Simulación
Durante la simulación observa:- Progreso de la conversación en tiempo real
- Calidad de respuestas del agente
- Cumplimiento del objetivo del usuario simulado
- Naturalidad del diálogo entre ambas partes
Gestionar Tests
Operaciones Básicas
- Editar
- Clonar
- Eliminar
- Haz clic en el menú (⋮) → Editar
- Modifica conversación, criterios o ejemplos
- Los cambios se aplican inmediatamente
Filtrado Avanzado
Organización de Tests
Usar Nombres Descriptivos
- “Saludo inicial profesional”
- “Manejo de objeción precio alto”
- “Transferencia a humano - caso complejo”
Agrupar por Funcionalidad
- Tests de saludo y bienvenida
- Tests de manejo de objeciones
- Tests de finalización de conversación
Priorizar por Criticidad
- Tests críticos: flujos principales
- Tests importantes: casos comunes
- Tests exploratorios: edge cases
Resultados y Análisis
Estados de Tests
Análisis de Tendencias
El sistema rastrea métricas históricas para identificar:- Degradación de calidad tras cambios
- Mejoras consistentes en el tiempo
- Tests inestables que requieren revisión
- Patrones de fallo recurrentes
Métricas de Rendimiento
- Tiempo de Respuesta
- Uso de Tokens
- Tasa de Éxito
- Promedio por test
- Variación entre ejecuciones
- Comparación con versiones anteriores
Integración con Copilot
Análisis Automático de Fallos
Cuando tests fallan repetidamente, Copilot:Detecta Patrones
Genera Diagnóstico
Propone Soluciones
Facilita Implementación
Tipos de Mejoras Sugeridas
- Prompts del Sistema
- Base de Conocimientos
- Configuración de Acciones
Flujo de Mejora Continua
- Ejecutar tests después de cada cambio
- Identificar fallos y patrones problemáticos
- Consultar Copilot para sugerencias de mejora
- Implementar cambios recomendados
- Validar mejoras con re-testing
- Documentar aprendizajes para referencia futura
Mejores Prácticas Avanzadas
Estrategia de Testing Integral
Estrategia de Testing Integral
- Tests de flujos principales (happy path)
- Tests de manejo de errores y excepciones
- Tests de edge cases y situaciones inusuales
- Tests de integración con acciones externas
- 70% tests de escenario (casos conocidos)
- 30% tests de simulación (exploración)
Optimización de Variables
Optimización de Variables
- Usa
fecha_y_hora_actualpara contexto temporal - Incluye variables de cliente para personalización
- Mantén valores realistas y representativos
- Actualiza regularmente para mantener relevancia
- Configura variables antes de cada ejecución batch
- Documenta el propósito de cada variable
- Usa nombres descriptivos (ej.
cliente_telefonovstel)
Análisis de Resultados Avanzado
Análisis de Resultados Avanzado
- Agrupa fallos por tipo de problema
- Rastrea métricas de rendimiento en el tiempo
- Compara resultados entre versiones del agente
- Identifica correlaciones entre cambios y resultados
- Revisa tendencias semanales/mensuales
- Identifica tests que se vuelven obsoletos
- Detecta degradación gradual de calidad
Integración con Desarrollo
Integración con Desarrollo
- Ejecuta suite completa antes de cada release
- Valida cambios críticos con repeticiones múltiples
- Mantén tests de regresión para funcionalidades clave
- Documenta casos de test para conocimiento del equipo
- Establece umbrales mínimos de éxito (ej. 90%)
- Configura alertas para fallos críticos
- Integra feedback de Copilot en proceso de desarrollo
Mantenimiento de Tests
Mantenimiento de Tests
- Revisa y actualiza tests regularmente
- Elimina tests redundantes o obsoletos
- Añade tests para nuevas funcionalidades
- Mantén ejemplos actualizados y relevantes
- Documenta propósito y contexto de cada test
- Comparte patrones de fallo y soluciones
- Establece convenciones de naming y organización

