판정 엔진은 빠르게 커지는 AI 분야입니다. 상황 하나와 정해진 형식의 질문을 읽고, 모든 선택지에 확률을 매겨 답합니다. S1MB(System One Mosaic Benchmark)는 이런 판정 엔진을 가장 넓게 비교하는 공개 리더보드입니다. 영어 벤치 137개를 세 가지 질문 형식으로 잽니다. 예/아니오(Noul), 고르기(Choice), 등급 매기기(Score)입니다.
비드래프트의 새 모델 Darwin-27B-ZTC-v2가 S1MB 1위에 올랐습니다. S1MB 운영자가 우리 결과를 검증하고 병합했습니다. 리더보드의 두 가지 순위 방식 모두에서 1위입니다.
점수
리더보드 화면이 쓰는 계산 코드를 공개 결과 파일에 그대로 적용했습니다. 137개 벤치를 모두 끝낸 모델 102개가 대상입니다.
| 순위 | 모델 | Borda 점수 | Task Avg | 예/아니오 | 고르기 | 등급 |
|---|---|---|---|---|---|---|
| 1 | Darwin-27B-ZTC-v2 | 89.58 | 66.46 | 67.66 | 71.51 | 60.21 |
| 2 | openjev | 87.50 | 62.60 | 65.22 | 67.74 | 54.83 |
| 3 | AutoJev-27B | 87.07 | 60.80 | 64.96 | 68.11 | 49.34 |
| 4 | Eikos-27B | 85.43 | 59.86 | 64.14 | 67.61 | 47.83 |
| 5 | TypeSafe Jev 1.13 | 85.05 | 59.59 | 64.63 | 67.22 | 46.92 |
- Borda 점수(기본 정렬): 벤치마다 모델 순위를 매겨 1등에 100점, 꼴찌에 0점을 주고 137개 벤치의 평균을 냅니다.
- Task Avg: 질문 형식별로 기준선 보정 점수의 평균을 내고, 세 형식을 다시 평균합니다.
세 가지 질문 형식 모두에서 1위입니다. 차이가 가장 큰 것은 등급 매기기입니다. 우리는 60.21, 다음 모델은 54.83입니다.
작동 방식
ZTC는 「토큰을 만들지 않는 판정(zero-token classification)」입니다. 모델은 선택지를 프롬프트에 나열하고, 순전파 한 번으로 마지막 은닉 상태에서 모든 선택지의 확률을 읽습니다. 글자를 생성하지 않기 때문에 판정 한 번에 27B 모델을 한 번만 돌리면 됩니다.
v2는 Darwin-27B-ZTC를 바탕으로 만들었습니다. Darwin-27B-ZTC는 허깅페이스 공식 Typed Decisions 리더보드 1위 모델입니다(0.743, zero-shot). v2는 제어·업무 판정 과제의 공개 학습 데이터로 이어서 학습한 뒤, v1과 가중치를 반씩 섞었습니다. 섞은 덕분에 v1의 실력은 지키고 새 실력을 더했습니다.
재현
- 가중치, 추론 코드,
/v1/systemone서버 코드를 모델 페이지에 공개했습니다. - S1MB 측정은 평가기에 이미 있는
autojev어댑터를 그대로 썼습니다. - 학습에는 공개 학습 데이터만 썼습니다. S1MB 시험 문제 전부와 대조해서 겹치는 문제가 0건임을 확인했습니다.
모델: https://huggingface.co/FINAL-Bench/Darwin-27B-ZTC-v2
리더보드: https://huggingface.co/spaces/hotchpotch/S1MB-leaderboard
Top comments (0)