Potato 2.1:實例顯示、視覺 AI 和跨度連結
Potato 2.1.0 帶來了實例顯示系統、支援影像和影片標註的視覺 AI、跨度連結、多欄位跨度以及佈局自定義功能。
**注意:**本文描述的是 Potato 2.1 釋出時的樣子。部分配置鍵和功能在後續版本中已經變了。最新的配置語法見當前文件。
我們很高興地宣佈 Potato 2.1.0 釋出,這個功能豐富的版本為標註平臺帶來了五項重大能力。此次更新專注於多模態內容顯示、AI 驅動的視覺標註以及更豐富的關係標註。
實例顯示系統
v2.1 的核心功能是全新的 instance_display 配置塊。以前,要在單選按鈕旁邊顯示圖片需要使用一些不太優雅的變通方法,比如建立一個 min_annotations: 0 的 image_annotation 方案。現在您可以明確地將要顯示的內容與要收集的標註分開。
instance_display:
layout:
direction: horizontal
gap: 24px
fields:
- key: image_url
type: image
label: "Image to Classify"
display_options:
max_width: 600
zoomable: true
- key: description
type: text
label: "Context"
annotation_schemes:
- annotation_type: radio
name: category
labels: [nature, urban, people, objects]實例顯示支援 11 種內容類型:text、html、image、video、audio、dialogue、pairwise、code、spreadsheet、document 和 pdf。您可以將多個顯示欄位與任何標註方案結合,水平或垂直排列,並通過 span_target: true 在文本欄位上啟用跨度標註。
一個突出的功能是逐輪對話評分 — 您可以在各個對話輪次中新增內聯的 Likert 量表評分元件,讓標註者在不離開對話檢視的情況下評價特定的發言者。
多欄位跨度標註
跨度標註現在支援 target_field 選項,可以在同一資料實例中對多個文本欄位進行標註。這對於摘要評估等任務至關重要,因為您需要在源文件和摘要中同時標註實體。
annotation_schemes:
- annotation_type: span
name: source_entities
labels: [PERSON, ORGANIZATION, LOCATION]
- annotation_type: span
name: summary_entities
labels: [PERSON, ORGANIZATION, LOCATION]輸出標註按欄位名稱分組,清楚地標明每個跨度屬於哪個文本欄位。
跨度連結
新的 span_link 標註類型通過在標註的跨度之間建立有類型的關係來實現關係抽取。這使知識圖譜構建、共指消解和話語分析等任務成為可能。
annotation_schemes:
- annotation_type: span
name: entities
labels:
- name: "PERSON"
color: "#3b82f6"
- name: "ORGANIZATION"
color: "#22c55e"
- annotation_type: span_link
name: relations
span_schema: entities
link_types:
- name: "WORKS_FOR"
directed: true
allowed_source_labels: ["PERSON"]
allowed_target_labels: ["ORGANIZATION"]
color: "#dc2626"
- name: "COLLABORATES_WITH"
directed: false
allowed_source_labels: ["PERSON"]
allowed_target_labels: ["PERSON"]
color: "#06b6d4"主要功能包括有向和無向連結、N 元關係(兩個以上跨度之間的連結)、文本上方的視覺弧線顯示,以及限制哪些實體類型可以參與各關係類型的標籤約束。
視覺 AI 支援
Potato 2.1 引入了四個新的視覺端點,為影像和影片標註任務帶來 AI 驅動的輔助功能。這是 Potato AI 能力從文本擴充套件到視覺領域的重大突破。
四個視覺端點
YOLO — 最適合使用本地推理進行快速、精確的目標檢測。支援 YOLOv8 變體和用於開放詞彙檢測的 YOLO-World。
ai_support:
enabled: true
endpoint_type: "yolo"
ai_config:
model: "yolov8m.pt"
confidence_threshold: 0.5
iou_threshold: 0.45Ollama Vision — 使用 Ollama 在本地執行視覺語言模型。支援 LLaVA、Llama 3.2 Vision、Qwen2.5-VL、BakLLaVA 和 Moondream。
ai_support:
enabled: true
endpoint_type: "ollama_vision"
ai_config:
model: "llava:latest"
base_url: "http://localhost:11434"OpenAI Vision — 基於雲的視覺分析,使用 GPT-4o,可配置細節級別。
ai_support:
enabled: true
endpoint_type: "openai_vision"
ai_config:
api_key: "${OPENAI_API_KEY}"
model: "gpt-4o"
detail: "auto"Anthropic Vision — Claude 具有視覺能力,可用於影像理解和分類。
ai_support:
enabled: true
endpoint_type: "anthropic_vision"
ai_config:
api_key: "${ANTHROPIC_API_KEY}"
model: "claude-sonnet-4-20250514"影像 AI 功能
對於影像標註任務,視覺 AI 提供四種輔助模式:
- 檢測 — 查詢與您配置的標籤匹配的目標,並以虛線疊加層繪製建議的邊界框
- 預標註(自動) — 自動檢測影像中的所有目標,並建立供人工稽核的建議
- 分類 — 對選定區域或整個影像進行分類,並給出置信度分數
- 提示 — 提供指導而不透露確切位置,適用於標註者培訓
annotation_schemes:
- annotation_type: image_annotation
name: object_detection
tools: [bbox, polygon]
labels:
- name: "person"
color: "#FF6B6B"
- name: "car"
color: "#4ECDC4"
ai_support:
enabled: true
features:
detection: true
pre_annotate: true
classification: false
hint: true影片 AI 功能
對於影片任務,視覺 AI 新增了場景檢測(識別場景邊界並建議時間片段)、關鍵幀檢測(找到重要時刻)以及目標跟蹤(建議跨幀的目標位置)。
接受/拒絕工作流
AI 建議以虛線疊加層形式出現,標註者可以接受(雙擊)、拒絕(右擊)、全部接受或全部清除 — 在加速標註的同時保持人在迴路中。
分離視覺和文本端點
您可以為文本和視覺任務配置不同的 AI 端點,為每種內容類型使用最佳模型:
ai_support:
enabled: true
endpoint_type: "ollama" # Text annotations
visual_endpoint_type: "yolo" # Image/video annotations
ai_config:
model: "llama3.2"
visual_ai_config:
model: "yolov8m.pt"
confidence_threshold: 0.5佈局自定義
Potato 2.1 增加了對複雜自定義視覺佈局的支援。Potato 預設生成一個可編輯的 layouts/task_layout.html 檔案,您可以提供包含 CSS 網格佈局、顏色編碼選項和區塊樣式的完全自定義 HTML 模板。
task_layout: layouts/custom_task_layout.htmlproject-hub/layout-examples/ 中包含三個示例佈局:
- 內容稽核 — 警告橫幅、2 列網格、按嚴重程度顏色編碼
- 對話問答 — 案例後設資料、圓形 Likert 評分、分組評估
- 醫學審查 — 專業醫學樣式、結構化報告
自定義佈局與新的 instance_display 系統協同工作 — 顯示內容渲染在您的自定義標註表單上方。
其他改進
標籤理由
第四種 AI 能力加入了提示、關鍵詞高亮和標籤建議的行列。理由功能為每個標籤可能適用的原因生成平衡的解釋,幫助標註者理解不同分類背後的推理。
ai_support:
features:
rationales:
enabled: true錯誤修復和測試
- 新增 50 多項測試以提高可靠性
- 各標註類型的響應式設計改進
- 增強的 project-hub 組織結構和佈局示例
升級到 v2.1
pip install --upgrade potato-annotation現有的 v2.0 配置無需修改即可使用 — 所有新功能都通過額外的配置塊(如 instance_display、span_link 方案和視覺 AI 端點)選擇性啟用。