Skip to content

ブログ

Potatoチームからのニュース、チュートリアル、最新情報。

GuidesSep 9, 2026

一致度では追認を捉えられない

アノテーターが読まずにモデルの事前ラベルを受け入れると、アノテーター間一致度は上がります。アノテーションから計算されるあらゆる品質指標が改善します。残された信号は所要時間だけです。

Potato Team1 min read
一致度では追認を捉えられない
Guides1 min read

「部分的」は実在の結果:ロボットのエピソードをアノテーションする

Guides1 min read

ブラウザのタブで動くセグメンテーションを出荷する

Guides1 min read

生の IoU は一致度ではない

Announcements2 min read

Potato 2.8:何にでもアノテーションし、そして測る

Guides1 min read

ジャッジを裁く:人間とモデルの推論を並べて見る

Announcements1 min read

Potato 2.7.1:文字起こしはもうできている

Guides1 min read

キャリブレーション会議を計測する

Guides1 min read

ゴールドラベルなしの品質管理

Stay updated

Get notified about new tutorials, releases, and community highlights.

Guides1 min read

アノテーション研究のための検証済み調査尺度:パーソナリティ、感情、ウェルビーイング、デモグラフィック

Guides1 min read

アノテーションデータセットを文書化する:データステートメント、データシート、そして文書化されていないデータが劣化する理由

Announcements2 min read

Potato 2.0 が ACL 2026 で発表

Guides2 min read

音声・動画エージェントを評価する

Announcements2 min read

Potato 2.6:定性データ分析とエージェント評価の融合

Announcements1 min read

Potato 2.6.2:完全なオープンソースのエージェント評価スイート

Guides1 min read

不一致はノイズではなくシグナルである:アノテーターの不一致を解消せずに残すべきとき

Guides1 min read

完全な重複を超えて:大規模データセットのための適応的なアノテーターカバレッジ

Guides2 min read

評価から訓練データへ:SFT と DPO のための軌跡編集

Guides1 min read

エージェントの軌跡に信頼できるラベルを付ける方法

Guides2 min read

LLM ジャッジを信頼できるか? LLM-as-Judge を人間と照らして校正する

Guides2 min read

Potato に質的コーディングを:コードブック、メモ、イン・ヴィヴォ・コード

Tutorials6 min read

見る・止める・巻き戻す:Potatoのライブコーディングエージェント観察

Guides8 min read

AIエージェントを並べて比較する:バイナリ・スケール・多次元の3モード

Guides7 min read

ステップ単位のエラー局所化:トラジェクトリ評価でエージェントの失敗箇所を突き止める

Tutorials5 min read

AIコーディングエージェント向けのGitHub PRスタイルのコードレビュー

Release2 min read

Potato 2.4.0:Webエージェントアノテーション、ライブ評価、HuggingFace連携

Announcements5 min read

Potato 2.3: エージェント型アノテーション、Solo Mode、そして人間による評価の未来

Guides6 min read

AIエージェントの評価:エージェントトレースの人間アノテーション完全ガイド

Tutorials5 min read

Solo Mode:1人のアノテーターで10,000件のラベリングを行う方法