콘텐츠로 이동

🧠 학습데이터(정답셋)

라벨링(Workforce)과 모델 만들기(ML), 두 축이 봉합되는 지점이 이 카테고리입니다. 완료확정된 할당작업이 학습에 적격한지(qualifiesForTraining) 게이트를 통과시키고, 적격한 라벨을 정답셋(GT)에 모아 학습데이터 버전으로 얼리는 여정을 다룹니다. "라벨링 끝난 데이터를 학습으로 넘기고 싶다", "정답셋에 뭐가 들어있는지 보고 싶다"면 이 페이지입니다.

flowchart LR
    A["🏭 완료확정 할당작업<br/>(Workforce)"] --> B{{"check_training_eligibility<br/>게이트"}}
    B -->|적격| C["🧠 정답셋(GT)"]
    C --> D["학습데이터 버전<br/>(불변 스냅샷)"]
    B -->|부적격| X["GT 에 넣지 않음"]
    style B fill:#f9e79f,stroke:#b7950b,color:#000

불변식 — 미리 알아야 할 것

  • 정답셋(GT)은 버전으로만 운영되며 직접 삭제할 수 없습니다. 버전 저장은 그 시점 구성을 불변으로 얼립니다(leakage 방지·재현 앵커). 기본 bump=Minor, split 8:1:1.
  • 학습은 실험 목적과 연결된 학습데이터 버전만 쓸 수 있고, 학습 완료분만 모델로 등록됩니다 → 실험·모델·추론.
  • 할당작업은 완료확정 후 수정 불가이며, 완료확정과 불량확정은 동시에 될 수 없습니다(상호배타).
  • 데이터유닛을 삭제하면 파생된 작업·할당작업·정답데이터에 접근할 수 없습니다 — 원천 데이터 관리는 데이터 준비 참조.

qualifiesForTraining — 학습 적격 조건 4항

라벨 데이터를 학습으로 넘기려면 다음을 모두 만족해야 합니다.

  1. 완료확정(is_confirmed) 이고
  2. 불량 아님 이고
  3. 보류 아님 이고
  4. (검수를 사용하는 워크샵이면) 검수완료

미충족 데이터는 정답셋(GT)에 넣지 마세요. check_training_eligibility 가 이 조건을 항별로 평가합니다.

도구 한눈에

도구 무엇을 할 때 쓰기 여부
check_training_eligibility 할당작업이 학습에 적격한지 항별 평가 읽기
list_ground_truth_datasets 정답셋(컨테이너) 목록 조회 읽기
get_ground_truth_dataset 정답셋 1건 상세 조회 읽기
create_ground_truth_dataset 정답셋 생성 ✏️ 쓰기(confirm)
update_ground_truth_dataset 정답셋 이름/설명 수정 ✏️ 쓰기(confirm)
delete_ground_truth_dataset 정답셋 삭제 ⚠️ 파괴적(confirm)
list_ground_truths 정답셋 개별 항목 목록 (클래스 서버 필터) 읽기
get_ground_truth 정답셋 항목 1건 상세 조회 읽기
list_ground_truth_versions 학습데이터 버전 목록 조회 읽기

도구 상세

check_training_eligibility

🧠 ML 이음매 — 두 축의 봉합 게이트입니다. 할당작업이 학습에 적격한지(qualifiesForTraining)를 완료확정 · 불량아님 · 보류아님 · (검수 활성 워크샵이면) 검수완료 네 항목으로 나눠 평가합니다. 완료확정된 라벨을 정답셋(GT)에 넣기 전에 게이트로 호출하세요.

  • 주요 인자: assignment_id (평가할 할당작업 ID — 할당작업 목록에서 확인).
  • 주의: 불량확정 여부는 v2 API 로 확인할 수 없어 조건부로 판정합니다.
  • 함께 보기: 할당작업의 상태·완료확정은 워크샵·검수 · 통과 후 담을 그릇은 create_ground_truth_dataset.

list_ground_truth_datasets

정답셋(GT 데이터셋, 평가 기준 데이터)의 컨테이너 목록을 조회합니다. 어떤 정답셋이 있는지 찾거나 둘러볼 때 호출하세요. 개별 항목(라벨 하나하나)은 list_ground_truths 로 봅니다.

get_ground_truth_dataset

정답셋 1건의 상세를 확인합니다. list_ground_truth_datasets 에서 얻은 id 로 조회하세요.

  • 주요 인자: id (정답셋 ID).

create_ground_truth_dataset

정답셋(GT 데이터셋)을 새로 만듭니다. 완료확정된 라벨(check_training_eligibility 게이트 통과분)을 담을 컨테이너가 필요할 때 호출하세요.

  • 주요 인자: name (이름) · description (설명, 선택).
  • 안전장치: 기본은 dry-run 미리보기(검증만, 미생성) → confirm=true 로 다시 호출해야 실제 생성.

update_ground_truth_dataset

정답셋의 name/description 을 수정합니다. 이름이나 설명을 정리하고 싶을 때 호출하세요.

  • 주요 인자: id (정답셋 ID) · name · description.
  • 안전장치: 기본은 dry-run 미리보기(검증만, 미변경) → confirm=true 로 다시 호출해야 실제 수정.

delete_ground_truth_dataset

정답셋을 삭제합니다. 더 이상 쓰지 않는 정답셋 컨테이너를 정리할 때만 신중히 호출하세요.

  • 주요 인자: id (정답셋 ID) · name.
  • 안전장치: 기본은 dry-run 미리보기(검증만, 미삭제) → confirm=true 로 다시 호출해야 실제 삭제.

list_ground_truths

🧠 정답셋(GT)의 개별 항목 목록입니다. classes 인자로 클래스 코드 기준 GT 검색이 가능하며, 이는 서버 필터라서 스캔 없이 바로 좁혀집니다. "OO 클래스가 들어간 정답 데이터를 찾고 싶다"면 이 도구입니다.

클래스로 찾기 — 대상이 무엇인가요?

  • 정답셋(GT) 항목을 클래스로 찾기 → 이 도구의 classes 서버 필터 (빠름).
  • 아직 GT 가 아닌 라벨링 task 를 클래스로 찾기 → find_tasks_by_class (스캔 기반, 별개 대상).
  • 주요 인자: ground_truth_dataset (정답셋 ID) · task (작업 ID) · classes (클래스 코드 배열, 서버 필터) · category (train/validation/test) · 페이지네이션(cursor/per_page).
  • 함께 보기: 컨테이너(정답셋 자체) 목록은 list_ground_truth_datasets · 항목 상세는 get_ground_truth.

get_ground_truth

🧠 정답셋 항목 1건의 상세를 확인합니다. list_ground_truths 에서 얻은 id 로 조회하며, classesdata(라벨 payload)를 포함합니다 — 긴 값은 절단 요약됩니다.

  • 주요 인자: ground_truth_id (정답셋 항목 ID).

list_ground_truth_versions

🧠 정답셋(GT 데이터셋)의 학습데이터 버전(GTDV) 목록입니다. "이 정답셋에 어떤 버전이 있는지" 확인할 때 호출하세요. 버전은 그 시점 구성을 불변으로 얼린 스냅샷이므로, 학습에 실제로 쓰이는 단위가 무엇인지 여기서 봅니다.

  • 주요 인자: gt_dataset_id (정답셋 ID) · 페이지네이션(cursor/per_page).
  • 주의: 버전 생성은 범위 밖 — 이 도구는 조회 전용입니다.
  • 함께 보기: 버전을 소비하는 다음 단계(학습→모델)는 실험·모델·추론 · 모델이 어떤 버전에서 왔는지는 get_model_lineage.