Evaluación de agentes
Evaluación de salidas de agentes por personas y por jueces LLM: calibración del juez, revisión de trazas, edición de trayectorias, evaluadores programáticos y CI.
Esta sección trata la salida de un modelo como algo que se revisa, no como algo que se etiqueta. La unidad de trabajo suele ser una traza: una ejecución de un agente, con sus llamadas a herramientas, sus pasos intermedios y su respuesta final.
Calibración de LLM como juez y Alineación juez ↔ humano cubren el caso en que la calificación la hace un modelo y necesitas saber hasta dónde fiarte. Evaluación de trazas en tres paneles (eval_trace) cubre el caso en que la hace una persona. Evaluación en CI cubre cómo ejecutar cualquiera de las dos en cada commit.
Potato no entrena modelos. Todo lo de aquí produce etiquetas, puntuaciones y estadísticas de acuerdo; lo que hagas después con ellas ocurre fuera de la herramienta.