Construye el conjunto de evaluación
Empieza con conversaciones y documentos reales, elimina datos sensibles y convierte errores conocidos en casos permanentes. Separa pruebas normales, límites y ataques.
- ✓Entrada, contexto esperado y criterio de éxito.
- ✓Casos representativos de usuarios y dispositivos.
- ✓Casos adversarios y entradas incompletas.
- ✓Resultado de referencia cuando exista.
- ✓Etiqueta del fallo y severidad operativa.
Evalúa utilidad, no solo exactitud
La corrección factual es una dimensión. También importan relevancia, completitud, claridad, tono, citas y capacidad de reconocer incertidumbre.
Pruebas deterministas
Formato, campos requeridos, enlaces, cálculos y reglas que pueden comprobarse por código.
Revisión humana
Criterio experto para utilidad, riesgo y matices del dominio.
Evaluador con modelo
Útil para escalar comparaciones, siempre calibrado contra muestras revisadas por personas.
Métricas de producto
Finalización, corrección aplicada, abandono, escalado y satisfacción.
Ataca las fronteras
Prueba si contenido externo intenta cambiar las instrucciones, si el sistema revela información o si una herramienta puede actuar fuera de su alcance.
- ✓Prompt injection directa e indirecta.
- ✓Separación entre usuarios, sesiones y organizaciones.
- ✓Permisos mínimos por herramienta y acción.
- ✓Confirmación antes de publicar, borrar, pagar o enviar.
- ✓Redacción de secretos, tokens y datos personales en registros.
Ensaya el fallo
Desconecta proveedores, fuerza timeouts, supera límites y entrega respuestas mal formadas. El producto debe degradarse con claridad.
- ✓Timeout y reintentos con límites.
- ✓Fallback entre modelos o rutas deterministas.
- ✓Idempotencia para no repetir acciones.
- ✓Mensaje honesto cuando no puede completar la tarea.
- ✓Escalado humano con contexto suficiente.
- ✓Comparación de regresiones antes de cada publicación.