01

Construye el conjunto de evaluación

Empieza con conversaciones y documentos reales, elimina datos sensibles y convierte errores conocidos en casos permanentes. Separa pruebas normales, límites y ataques.

  • Entrada, contexto esperado y criterio de éxito.
  • Casos representativos de usuarios y dispositivos.
  • Casos adversarios y entradas incompletas.
  • Resultado de referencia cuando exista.
  • Etiqueta del fallo y severidad operativa.
02

Evalúa utilidad, no solo exactitud

La corrección factual es una dimensión. También importan relevancia, completitud, claridad, tono, citas y capacidad de reconocer incertidumbre.

Pruebas deterministas

Formato, campos requeridos, enlaces, cálculos y reglas que pueden comprobarse por código.

Revisión humana

Criterio experto para utilidad, riesgo y matices del dominio.

Evaluador con modelo

Útil para escalar comparaciones, siempre calibrado contra muestras revisadas por personas.

Métricas de producto

Finalización, corrección aplicada, abandono, escalado y satisfacción.

03

Ataca las fronteras

Prueba si contenido externo intenta cambiar las instrucciones, si el sistema revela información o si una herramienta puede actuar fuera de su alcance.

  • Prompt injection directa e indirecta.
  • Separación entre usuarios, sesiones y organizaciones.
  • Permisos mínimos por herramienta y acción.
  • Confirmación antes de publicar, borrar, pagar o enviar.
  • Redacción de secretos, tokens y datos personales en registros.
04

Ensaya el fallo

Desconecta proveedores, fuerza timeouts, supera límites y entrega respuestas mal formadas. El producto debe degradarse con claridad.

  • Timeout y reintentos con límites.
  • Fallback entre modelos o rutas deterministas.
  • Idempotencia para no repetir acciones.
  • Mensaje honesto cuando no puede completar la tarea.
  • Escalado humano con contexto suficiente.
  • Comparación de regresiones antes de cada publicación.