Skip to content
Potato
Why Potato
Docs
Blog
Showcase
Playground
Tools
Community
Get Started
Open main menu
Showcase
/
Surveys
Surveys
63 annotation designs you can copy and run. Each ships a
config.yaml
and sample data.
All surveys designs
AgentBoard Progress Scoring
AnnoMI Counselling Dialogue Annotation
Annotator Demographics with Consent
Argument Reasoning Comprehension (ARCT)
Assessing Humor in Edited News Headlines
Automated Essay Scoring
BigCodeBench Human Baseline Evaluation
Claim Perspectives (Perspectrum)
Clickbait Detection (Webis Clickbait Corpus)
Commonsense QA Explanation (ECQA)
Connotation Frames of Power and Agency
Conversation Quality Attributes
Coreference Resolution (OntoNotes)
Deceptive Review Detection
DICES Diversity in Conversational AI Safety
DimABSA: Dimensional Aspect-Based Sentiment Analysis
Dynamic Hate Speech Detection
Emotion Detection (SemEval-2018 Task 1)
Emotional Valence and Arousal over Time from Ecological Essays
Empathetic Dialogue Annotation
ESA: Error Span Annotation for Machine Translation
FinBERT - Financial Headline Sentiment Analysis
Fine-Grained Sentiment Analysis on Financial Microblogs and News
FLORES - Machine Translation Quality Estimation
Graded Word Similarity in Context
HELM - Model Card Display and Evaluation
Implicit Hate Speech Detection
JFLEG Fluency Rewriting for Grammatical Error Correction
Lexical Complexity Prediction
Likert Scale Survey
LongEval: Faithfulness Evaluation for Long-Form Summarization
Machine Translation Evaluation
MT-Bench Judge Consistency Evaluation
MT-Bench: Multi-Turn LLM Evaluation Benchmark
MTRAGEval: Evaluating Multi-Turn RAG Conversations
Multilingual News Article Similarity
Multilingual Semantic Word Similarity
News Headline Emotion Roles (GoodNewsEveryone)
NLI with Explanations (e-SNLI)
OSWorld: Desktop Agent Task Evaluation
Politeness Transfer Annotation
PreTENS - Presuppositional Acceptability
Prometheus: Rubric-Based LLM Evaluation
Rating Plausibility of Word Senses through Narrative Understanding
RefactorBench Multi-File Evaluation
RT-2 - Robotic Action Annotation
Rumor Stance Detection (PHEME)
SayCan: Grounding Language in Robotic Affordances
SciFact: Scientific Claim Verification Dataset
Semantic Textual Relatedness
SemEval-2021 Task 7: HaHackathon Humor Detection
SHROOM: Shared-task on Hallucinations and Related Observable Overgeneration Mistakes
Social Chemistry 101 (Social Norms)
Stance Detection (VAST)
STS-B: Semantic Textual Similarity Benchmark
Survey Feedback
tau-bench Agent Evaluation
Text Summarization Evaluation
TREC Deep Learning Passage Ranking
Tweet Intimacy Analysis
Unlearning Sensitive Content from LLMs
Warmth and Competence (Sentence-Level Social Perception)
WildBench - LLM Evaluation on Real-World Tasks
Other categories
Text Annotation (212)
Image Annotation (41)
Video Annotation (32)
Audio Annotation (33)
Evaluation Tasks (39)
Preference Learning (32)
Comparison Tasks (4)