Skip to content

[P2-4] Benchmark V2를 실행하고 raw 결과를 공개한다 #53

Description

@jsleemaster

목표

동결된 프로토콜과 검증된 harness로 실험을 실행하고, Gooblin의 승패와 무관하게 누락 없는 원시 결과를 공개한다.

의존성

  • Benchmark V2 protocol 이슈
  • Benchmark V2 harness 이슈
  • reviewer/API budget 확보

최소 실행량

  • 단일 host/model: 8 tasks × 3 arms × 3회 = 72 runs
  • 두 환경을 비교하면 144 runs
  • arms: baseline / 10줄 수동 프롬프트 / 실제 설치 Gooblin

완료 조건

  • 모든 run에 repo SHA, task, arm, repetition, host/model, budget, token/time, output이 있다.
  • 실제 코드·테스트 결과와 blind human review가 연결된다.
  • 누락·timeout·실패도 삭제하지 않고 상태로 집계한다.
  • aggregate score에서 raw run으로 역추적할 수 있다.
  • 동일 model judge 편향을 제거하거나 별도 한계로 보고한다.
  • Gooblin이 지더라도 데이터 완전성과 재현성이 충족되면 이 이슈는 완료다.
  • 수동 프롬프트 대비 우위가 없으면 성능 향상 주장을 하지 않는다.

확장 중단 조건

Gooblin의 승리를 전제하지 않는다.

  • 10줄 수동 프롬프트 대비 의미 있는 품질 우위가 없으면 성능 향상 주장을 하지 않고 포지셔닝을 “재사용 가능한 판단 프롬프트/규약” 수준으로 낮춘다.
  • unintended activation이 기준을 넘거나 token/time 비용이 이득보다 크면 router를 축소하거나 opt-in direct invocation만 유지한다.
  • 역할 추가, MCP/LSP, 별도 runtime, telemetry, dashboard로 결과를 보상하지 않는다.
  • 축소·통합 결정도 raw 결과와 함께 공개한다.

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions