Skip to content
Announcements3 min read

Potato 2.1:實例顯示、視覺 AI 和跨度連結

Potato 2.1.0 帶來了實例顯示系統、支援影像和影片標註的視覺 AI、跨度連結、多欄位跨度以及佈局自定義功能。

Potato Team

**注意:**本文描述的是 Potato 2.1 釋出時的樣子。部分配置鍵和功能在後續版本中已經變了。最新的配置語法見當前文件

我們很高興地宣佈 Potato 2.1.0 釋出,這個功能豐富的版本為標註平臺帶來了五項重大能力。此次更新專注於多模態內容顯示、AI 驅動的視覺標註以及更豐富的關係標註。

實例顯示系統

v2.1 的核心功能是全新的 instance_display 配置塊。以前,要在單選按鈕旁邊顯示圖片需要使用一些不太優雅的變通方法,比如建立一個 min_annotations: 0image_annotation 方案。現在您可以明確地將要顯示的內容與要收集的標註分開。

yaml
instance_display:
  layout:
    direction: horizontal
    gap: 24px
  fields:
    - key: image_url
      type: image
      label: "Image to Classify"
      display_options:
        max_width: 600
        zoomable: true
    - key: description
      type: text
      label: "Context"
 
annotation_schemes:
  - annotation_type: radio
    name: category
    labels: [nature, urban, people, objects]

實例顯示支援 11 種內容類型:texthtmlimagevideoaudiodialoguepairwisecodespreadsheetdocumentpdf。您可以將多個顯示欄位與任何標註方案結合,水平或垂直排列,並通過 span_target: true 在文本欄位上啟用跨度標註。

一個突出的功能是逐輪對話評分 — 您可以在各個對話輪次中新增內聯的 Likert 量表評分元件,讓標註者在不離開對話檢視的情況下評價特定的發言者。

閱讀完整的實例顯示文件 →

多欄位跨度標註

跨度標註現在支援 target_field 選項,可以在同一資料實例中對多個文本欄位進行標註。這對於摘要評估等任務至關重要,因為您需要在源文件和摘要中同時標註實體。

yaml
annotation_schemes:
  - annotation_type: span
    name: source_entities
    labels: [PERSON, ORGANIZATION, LOCATION]
 
  - annotation_type: span
    name: summary_entities
    labels: [PERSON, ORGANIZATION, LOCATION]

輸出標註按欄位名稱分組,清楚地標明每個跨度屬於哪個文本欄位。

閱讀更新後的跨度標註文件 →

跨度連結

新的 span_link 標註類型通過在標註的跨度之間建立有類型的關係來實現關係抽取。這使知識圖譜構建、共指消解和話語分析等任務成為可能。

yaml
annotation_schemes:
  - annotation_type: span
    name: entities
    labels:
      - name: "PERSON"
        color: "#3b82f6"
      - name: "ORGANIZATION"
        color: "#22c55e"
 
  - annotation_type: span_link
    name: relations
    span_schema: entities
    link_types:
      - name: "WORKS_FOR"
        directed: true
        allowed_source_labels: ["PERSON"]
        allowed_target_labels: ["ORGANIZATION"]
        color: "#dc2626"
      - name: "COLLABORATES_WITH"
        directed: false
        allowed_source_labels: ["PERSON"]
        allowed_target_labels: ["PERSON"]
        color: "#06b6d4"

主要功能包括有向和無向連結、N 元關係(兩個以上跨度之間的連結)、文本上方的視覺弧線顯示,以及限制哪些實體類型可以參與各關係類型的標籤約束。

閱讀完整的跨度連結文件 →

視覺 AI 支援

Potato 2.1 引入了四個新的視覺端點,為影像和影片標註任務帶來 AI 驅動的輔助功能。這是 Potato AI 能力從文本擴充套件到視覺領域的重大突破。

四個視覺端點

YOLO — 最適合使用本地推理進行快速、精確的目標檢測。支援 YOLOv8 變體和用於開放詞彙檢測的 YOLO-World。

yaml
ai_support:
  enabled: true
  endpoint_type: "yolo"
  ai_config:
    model: "yolov8m.pt"
    confidence_threshold: 0.5
    iou_threshold: 0.45

Ollama Vision — 使用 Ollama 在本地執行視覺語言模型。支援 LLaVA、Llama 3.2 Vision、Qwen2.5-VL、BakLLaVA 和 Moondream。

yaml
ai_support:
  enabled: true
  endpoint_type: "ollama_vision"
  ai_config:
    model: "llava:latest"
    base_url: "http://localhost:11434"

OpenAI Vision — 基於雲的視覺分析,使用 GPT-4o,可配置細節級別。

yaml
ai_support:
  enabled: true
  endpoint_type: "openai_vision"
  ai_config:
    api_key: "${OPENAI_API_KEY}"
    model: "gpt-4o"
    detail: "auto"

Anthropic Vision — Claude 具有視覺能力,可用於影像理解和分類。

yaml
ai_support:
  enabled: true
  endpoint_type: "anthropic_vision"
  ai_config:
    api_key: "${ANTHROPIC_API_KEY}"
    model: "claude-sonnet-4-20250514"

影像 AI 功能

對於影像標註任務,視覺 AI 提供四種輔助模式:

  • 檢測 — 查詢與您配置的標籤匹配的目標,並以虛線疊加層繪製建議的邊界框
  • 預標註(自動) — 自動檢測影像中的所有目標,並建立供人工稽核的建議
  • 分類 — 對選定區域或整個影像進行分類,並給出置信度分數
  • 提示 — 提供指導而不透露確切位置,適用於標註者培訓
yaml
annotation_schemes:
  - annotation_type: image_annotation
    name: object_detection
    tools: [bbox, polygon]
    labels:
      - name: "person"
        color: "#FF6B6B"
      - name: "car"
        color: "#4ECDC4"
    ai_support:
      enabled: true
      features:
        detection: true
        pre_annotate: true
        classification: false
        hint: true

影片 AI 功能

對於影片任務,視覺 AI 新增了場景檢測(識別場景邊界並建議時間片段)、關鍵幀檢測(找到重要時刻)以及目標跟蹤(建議跨幀的目標位置)。

接受/拒絕工作流

AI 建議以虛線疊加層形式出現,標註者可以接受(雙擊)、拒絕(右擊)、全部接受或全部清除 — 在加速標註的同時保持人在迴路中。

分離視覺和文本端點

您可以為文本和視覺任務配置不同的 AI 端點,為每種內容類型使用最佳模型:

yaml
ai_support:
  enabled: true
  endpoint_type: "ollama"          # Text annotations
  visual_endpoint_type: "yolo"     # Image/video annotations
  ai_config:
    model: "llama3.2"
  visual_ai_config:
    model: "yolov8m.pt"
    confidence_threshold: 0.5

閱讀完整的視覺 AI 支援文件 →

佈局自定義

Potato 2.1 增加了對複雜自定義視覺佈局的支援。Potato 預設生成一個可編輯的 layouts/task_layout.html 檔案,您可以提供包含 CSS 網格佈局、顏色編碼選項和區塊樣式的完全自定義 HTML 模板。

yaml
task_layout: layouts/custom_task_layout.html

project-hub/layout-examples/ 中包含三個示例佈局:

  • 內容稽核 — 警告橫幅、2 列網格、按嚴重程度顏色編碼
  • 對話問答 — 案例後設資料、圓形 Likert 評分、分組評估
  • 醫學審查 — 專業醫學樣式、結構化報告

自定義佈局與新的 instance_display 系統協同工作 — 顯示內容渲染在您的自定義標註表單上方。

閱讀完整的佈局自定義文件 →

其他改進

標籤理由

第四種 AI 能力加入了提示、關鍵詞高亮和標籤建議的行列。理由功能為每個標籤可能適用的原因生成平衡的解釋,幫助標註者理解不同分類背後的推理。

yaml
ai_support:
  features:
    rationales:
      enabled: true

錯誤修復和測試

  • 新增 50 多項測試以提高可靠性
  • 各標註類型的響應式設計改進
  • 增強的 project-hub 組織結構和佈局示例

升級到 v2.1

bash
pip install --upgrade potato-annotation

現有的 v2.0 配置無需修改即可使用 — 所有新功能都通過額外的配置塊(如 instance_displayspan_link 方案和視覺 AI 端點)選擇性啟用。

開始使用


有問題或反饋?加入我們的 Discord 或在 GitHub 上提交 issue。