DEV Community

Vidraft_lab
Vidraft_lab

Posted on

S1MB 1위: 0토큰으로 판정해 디시전 엔진 리더보드를 제패하다

요약

System One Mosaic Benchmark(S1MB) 디시전 엔진 리더보드에서 우리 모델 Darwin-27B-ZTC-v2가 102개 모델 중 1위입니다. Borda 점수 89.58, 태스크 평균 66.46. 핵심은 판정 방식입니다. 한 번의 순전파로, 생성 토큰 0개로 결정합니다.

S1MB가 측정하는 것

S1MB는 타입드 결정 품질을 봅니다. 조건과 후보 선택지가 주어지면 모델이 맞는 것을 고르고 점수를 매깁니다. 텍스트 생성 벤치가 아니라 결정 벤치입니다. 출력이 타입드 정답키와 대조되므로 순위가 깔끔하고 재현됩니다. 애매한 문자열 매칭도, 판정용 2차 모델도 끼지 않습니다.

왜 0토큰이 유리한가

보통은 결정을 얻으려고 전체 생성 루프를 돌린 뒤 텍스트를 다시 파싱합니다. 느리고 비결정적이며, 생성 토큰마다 흔들릴 위험이 있습니다. 우리 방식 ZTC(Zero-Token Confidence)는 이를 건너뜁니다. 문제를 한 번의 순전파로 읽고, 마지막 층 은닉상태에 보정된 probe를 적용해 결정을 바로 냅니다.

# 순전파 1회, 생성 토큰 0개
h     = model(text).last_hidden_state[last_non_pad_token]
score = ((h - mu) / sd) @ w   # 보정 probe -> 타입드 결정
Enter fullscreen mode Exit fullscreen mode

샘플링이 없으니 같은 입력은 항상 같은 결정을 줍니다. 측정에도 운영에도 바람직한 성질입니다.

결과

지표 Darwin-27B-ZTC-v2
S1MB 순위 102개 중 1위
Borda 점수 89.58
태스크 평균 66.46

어디서 보나

FAQ

S1MB가 무엇인가?
타입드 결정 품질을 측정하는 벤치마크입니다. 조건과 후보가 주어지면 맞는 것을 고르고 점수를 매깁니다.

1위 모델은?
Darwin-27B-ZTC-v2. 102개 중 1위, Borda 89.58, 태스크 평균 66.46.

0토큰 판정이란?
생성 텍스트 없이 한 번의 순전파로 결정을 내는 방식입니다. 마지막 은닉상태에 보정 probe를 적용하며 결정적입니다.

오픈소스인가?
예, Apache-2.0입니다.

Top comments (0)