Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Noticias, tutoriales y novedades del equipo de Potato.
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

Potato ya puede registrar cómo producen los anotadores sus respuestas de texto libre, sin registrar lo que escriben, y convertir las pausas, las revisiones y los pegados en marcas auditables para respuestas que se pegaron en lugar de escribirse.
Un recorrido completo desde una carpeta de salida de Whisper hasta turnos de hablante etiquetados: elegir la unidad de anotación, resolver la diarización, escribir la configuración, poner la tarea en marcha y exportar con la alineación temporal intacta.



Get notified about new tutorials, releases, and community highlights.
El voto mayoritario tira casi todo lo que tus anotadores te dijeron. La teoría de respuesta al ítem le da a cada etiqueta una probabilidad posterior y un intervalo de confianza, estima la capacidad de los anotadores y la dificultad de los elementos, y encuentra las entradas rotas del manual de codificación, sin etiquetas de oro y sin ningún LLM.
Potato 2.7 añade etiquetas con barras de error, salas de normalización en vivo, sondas contrafactuales de frontera, puntuación por predicción entre pares, justificaciones habladas en local, informes de dataset con un solo comando y anotación desde el móvil, y nada de eso necesita un LLM. Además, evaluación de agentes multiagente y multimodales.

Un recorrido por la evaluación humana de agentes de computer-use y de GUI en Potato: juzgar cada acción, verificar el anclaje del clic sobre la captura de pantalla y revisar las llamadas a herramientas una a una.
Cómo encontrar por qué falló un sistema LLM multiagente usando Potato: el grafo de interacción, la atribución de fallos, la revisión de traspasos, los cuadros de mando por agente, la línea de tiempo de contención de herramientas y el etiquetado de comportamiento emergente.

El tiempo de revisión humana es el recurso más escaso en la evaluación de agentes. Potato 2.6 combina una cola de triaje basada en señales con la alineación juez-humano, para que las peores trazas lleguen primero a las personas y tu juez LLM siga mejorando.
La identidad del anotador moldea las etiquetas, así que los datos demográficos merecen recopilarse, pero solo con consentimiento, cuidado y un motivo. Una guía sobre qué preguntar, qué dejar en paz y cómo hacerlo en Potato.



A practical guide to deciding when an LLM can annotate your data, where model annotators fail, and how to combine automation with human verification in Potato.
Una mirada honesta sobre cómo elegir una herramienta de anotación de datos de código abierto, qué preguntas reducen realmente las opciones y dónde encaja Potato entre Label Studio, Prodigy, Doccano, brat y Argilla.



Potato ya admite la anotación de agentes de coding con renderizado de diffs, salida de terminal y esquemas de recompensa de proceso. Importa trazas de Claude Code, Aider y SWE-Agent.
Guía paso a paso para recopilar señales de recompensa por paso y entrenar PRM con Potato. Cubre el modo de primer error, la anotación por paso y la exportación a pipelines de entrenamiento.




Compara Potato con LangSmith, Langfuse, Labelbox y Scale AI para la evaluación de agentes: renderizado de trazas, anotación por paso y multiagente, revisión de agentes multimodales, agentes de coding, observación en vivo, precios y autoalojamiento.
Configura la evaluación multicriterio por rúbrica con criterios propios, escalas de valoración configurables y pesos por dimensión para evaluar agentes de IA de forma sistemática con el rubric_eval de Potato.


Cómo usar la visualización de trazas de agentes web de Potato para evaluar agentes autónomos de navegación web, con capturas de pantalla paso a paso, superposiciones SVG y esquemas de anotación por paso.
Potato 2.2.0 añade 9 nuevos esquemas de anotación, un sistema de exportación extensible, estimación de competencia MACE, 55 instrumentos de encuesta validados y fuentes de datos remotas.


Técnicas especializadas para anotar contratos, documentos judiciales y presentaciones regulatorias con experiencia en el dominio.
Mejores prácticas para anotar imágenes médicas usando las funciones estándar de anotación de imágenes de Potato.




Construye interfaces de comparación de imágenes lado a lado para clasificación de preferencias, pruebas A/B y evaluación de calidad.
Estamos emocionados de anunciar Potato 2.0 con funciones potenciadas por IA, soporte multimedia y capacidades de aprendizaje activo.



Crea interfaces de anotación personalizadas con plantillas HTML, estilos CSS e interactividad JavaScript.
Construye una tarea de anotación para aprendizaje de idiomas para calificar la calidad de pronunciación con reproducción de audio y escalas Likert.




Cómo calcular e interpretar el Kappa de Cohen, el Kappa de Fleiss y el Alpha de Krippendorff para tus proyectos de anotación.
Mejores prácticas para asegurar la calidad de anotación en proyectos de anotación, incluyendo estrategias prácticas que puedes implementar con y más allá de Potato.




Una visión general de los conceptos de anotación de seguimiento de múltiples objetos y cómo las capacidades de anotación de video de Potato pueden soportar flujos de trabajo básicos de seguimiento.
Crea una tarea de clasificación de emociones en audio con visualización de forma de onda, controles de velocidad de reproducción y escalas Likert.