좋아하는 결과 한 장을 골라 모델 전체의 능력을 평가하면 편향이 생기기 쉽습니다. 비교 전에는 입력 자료, 요청문, 도구 접근, 시간 제한과 평가 기준을 먼저 고정하세요. 같은 제품이라도 설정과 모델 버전이 다르면 별도 조건입니다.
버그 수정 비교라면 성공 기준은 실제 실패 사례 해결, 기존 동작 유지, 검증 근거, 불필요한 수정 여부로 만들 수 있습니다. 문서 요약 비교라면 사실 정확성, 빠진 핵심, 출처와 분량을 평가할 수 있습니다. 과제와 연결되지 않은 점수는 유용하지 않습니다.
여러 번 실행한 결과를 기록하고 실패도 남기세요. 사용할 수 있는 계정이나 도구가 달라 동일 조건이 아니었다면 그 한계를 공개합니다. 이 글은 특정 모델의 우위를 주장하는 평가가 아니라 재현 가능한 실험을 위한 편집 가이드입니다.