<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Vidraft_lab</title>
    <description>The latest articles on DEV Community by Vidraft_lab (@vidraft_lab).</description>
    <link>https://dev.to/vidraft_lab</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3850609%2Fe74d42e1-1b18-4f0c-b7c5-7e5faf348367.png</url>
      <title>DEV Community: Vidraft_lab</title>
      <link>https://dev.to/vidraft_lab</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/vidraft_lab"/>
    <language>en</language>
    <item>
      <title>재귀적 자가개선(RSI)이란 무엇인가: 사람 정답 0으로 스스로 배우는 모델</title>
      <dc:creator>Vidraft_lab</dc:creator>
      <pubDate>Tue, 06 Oct 2026 19:09:54 +0000</pubDate>
      <link>https://dev.to/vidraft_lab/jaegwijeog-jagagaeseonrsiiran-mueosinga-saram-jeongdab-0euro-seuseuro-baeuneun-model-20i8</link>
      <guid>https://dev.to/vidraft_lab/jaegwijeog-jagagaeseonrsiiran-mueosinga-saram-jeongdab-0euro-seuseuro-baeuneun-model-20i8</guid>
      <description>&lt;h2&gt;
  
  
  재귀적 자가개선(RSI)은 결국 무엇을 한다는 말인가?
&lt;/h2&gt;

&lt;p&gt;TL;DR: RSI(Recursive Self-Improvement, 재귀적 자가개선)는 모델이 스스로 문제를 만들어 풀고, 그 풀이 중에서 정답이 확실히 확인된 것만 골라 다시 학습 데이터로 삼아 자신을 개선하는 방식입니다. 핵심은 세 가지입니다. 첫째, 문제는 반드시 검증 가능해야 합니다. 둘째, 채점에 사람 정답표를 쓰지 않습니다. 셋째, 통과한 자기 풀이만 다음 학습에 남깁니다.&lt;/p&gt;

&lt;p&gt;보통의 학습은 사람이 만든 정답 데이터가 있어야 합니다. 질문과 모범답안을 짝지어 모델에게 보여주는 식입니다. 데이터를 모으고 라벨을 다는 일은 느리고 비쌉니다. RSI는 이 순서를 뒤집습니다. 모델 자신이 문제를 풀고, 그 결과를 스스로 검증하고, 맞은 것만 남겨 다시 배웁니다. 사람이 붙이는 정답 라벨이 0이라는 점이 가장 큰 차이입니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  사람 정답이 없는데 어떻게 맞았는지 아는가?
&lt;/h2&gt;

&lt;p&gt;비결은 검증 가능한 문제만 다룬다는 데 있습니다. 검증 가능한 문제란, 풀이가 맞는지를 정답표 없이도 기계적으로 확인할 수 있는 문제를 말합니다. 몇 가지 익숙한 예가 있습니다.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;코드: 테스트를 돌려 통과하면 맞은 것입니다.&lt;/li&gt;
&lt;li&gt;수학: 식을 다시 계산하거나 조건에 대입해 맞는지 봅니다.&lt;/li&gt;
&lt;li&gt;형식 문제: 출력이 정해진 규칙을 지켰는지 검사합니다.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;즉 채점 기준이 문제 안에 들어 있습니다. 모델이 내놓은 답을 다시 돌려보고, 통과한 풀이에는 합격, 실패한 풀이에는 불합격을 매깁니다. 사람이 앉아서 하나하나 맞다 틀리다를 적을 필요가 없습니다. 이 자동 채점이 RSI의 엔진입니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  왜 맞은 풀이만 남기는 것이 중요한가?
&lt;/h2&gt;

&lt;p&gt;모델이 만든 풀이에는 맞은 것과 틀린 것이 섞여 있습니다. 틀린 풀이를 그대로 다시 배우면 모델은 자기 실수를 정답으로 굳혀 버립니다. 오답을 합리화하는 법을 배우는 셈입니다. 그래서 RSI는 검증을 통과한 풀이만 골라 남깁니다. 걸러진 풀이는 버립니다.&lt;/p&gt;

&lt;p&gt;이 선별 덕분에 학습은 한 방향으로만 움직입니다. 확인된 성공 사례가 쌓이고, 모델은 다음 바퀴에서 조금 더 어려운 문제를 풀 수 있게 됩니다. 그 결과를 또 검증해 남기고, 다시 배웁니다. 이 고리가 반복되기 때문에 재귀적이라는 이름이 붙었습니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  매뉴얼을 고치는 자가개선과는 어떻게 다른가?
&lt;/h2&gt;

&lt;p&gt;자가개선이라는 말은 두 층위에서 쓰입니다. 하나는 모델을 감싼 작업 틀, 즉 평가 하네스나 프롬프트 같은 바깥 장치를 모델이 다듬는 방식입니다. 이는 매뉴얼을 고치는 쪽에 가깝습니다. 다른 하나는 모델의 능력 자체를 끌어올리는 방식입니다. 비드래프트가 말하는 Model-level RSI는 후자, 즉 두뇌를 키우는 쪽입니다. 매뉴얼을 아무리 잘 써도 두뇌가 그대로면 한계가 있다는 관점입니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  정리
&lt;/h2&gt;

&lt;p&gt;RSI를 한 문장으로 줄이면 이렇습니다. 채점이 자동으로 되는 문제만 골라, 모델이 스스로 풀고, 통과한 풀이만 다시 배우는 순환입니다. 사람 정답에 의존하지 않기 때문에 확장이 빠르고, 틀린 풀이를 걸러내기 때문에 방향이 흐트러지지 않습니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Q. RSI는 사람이 전혀 개입하지 않나요?&lt;/strong&gt;&lt;br&gt;
문제의 종류와 검증 방식, 어떤 능력을 키울지는 사람이 설계합니다. 다만 개별 풀이에 정답 라벨을 다는 일은 하지 않습니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q. 어떤 문제든 RSI로 학습할 수 있나요?&lt;/strong&gt;&lt;br&gt;
아닙니다. 풀이가 맞는지 자동으로 확인할 수 있는 검증 가능한 문제여야 합니다. 정답이 애매하거나 주관적인 문제는 이 방식에 맞지 않습니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q. 틀린 풀이는 어떻게 되나요?&lt;/strong&gt;&lt;br&gt;
검증을 통과하지 못한 풀이는 학습에서 제외합니다. 이것이 모델이 자기 실수를 굳히지 않게 막는 핵심 장치입니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q. 재귀적이라는 말은 무슨 뜻인가요?&lt;/strong&gt;&lt;br&gt;
풀고, 검증하고, 남기고, 다시 배우는 과정을 여러 바퀴 반복한다는 뜻입니다. 각 바퀴의 결과가 다음 바퀴의 출발점이 됩니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q. 일반적인 지도학습과 가장 큰 차이는?&lt;/strong&gt;&lt;br&gt;
지도학습은 사람이 만든 정답표가 필요합니다. RSI는 자동 채점으로 정답표를 대신하므로 사람 라벨이 0입니다.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>machinelearning</category>
      <category>research</category>
    </item>
    <item>
      <title>양자볼륨 세계 1위 퀀티넘 검토 통과: 비드래프트가 실기와 AI 솔버로 증명한 양자 역량</title>
      <dc:creator>Vidraft_lab</dc:creator>
      <pubDate>Tue, 06 Oct 2026 13:12:33 +0000</pubDate>
      <link>https://dev.to/vidraft_lab/yangjabolryum-segye-1wi-kweontineom-geomto-tonggwa-bideuraepeuteuga-silgiwa-ai-solbeoro-jeungmyeonghan-yangja-yeogryang-2hjh</link>
      <guid>https://dev.to/vidraft_lab/yangjabolryum-segye-1wi-kweontineom-geomto-tonggwa-bideuraepeuteuga-silgiwa-ai-solbeoro-jeungmyeonghan-yangja-yeogryang-2hjh</guid>
      <description>&lt;blockquote&gt;
&lt;p&gt;TL;DR&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;비드래프트가 양자볼륨 세계 1위 기업 퀀티넘(Quantinuum)의 검토를 거쳐 양자컴퓨팅 플랫폼 Nexus와 H-Series 이용 기업으로 선정됐다.&lt;/li&gt;
&lt;li&gt;문을 연 근거는 두 가지 실적이다. IBM 헤론(Heron) 실제 양자컴퓨터에서 Even-Mansour 키 복원을 N=4에서 N=10으로 확장한 암호분석, 그리고 단일 GPU로 2차원 허바드 모형을 검증하는 강상관 솔버 Δ-Engine이다.&lt;/li&gt;
&lt;li&gt;핵심 메시지: 양자 하드웨어를 직접 쓰는 역량과, AI로 양자 난제를 푸는 역량을 한 팀이 함께 보유했다는 점이다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  양자볼륨 세계 1위 퀀티넘은 왜 중요한가
&lt;/h2&gt;

&lt;p&gt;양자볼륨(Quantum Volume, QV)은 큐비트 수만이 아니라 게이트 충실도, 연결성, 측정 오류를 한데 묶어 측정하는 종합 성능 지표다. 숫자가 2의 거듭제곱으로 올라가기 때문에 체감 난도가 지수적으로 커진다.&lt;/p&gt;

&lt;p&gt;퀀티넘은 2021년부터 이 지표에서 세계 1위를 지켜 왔고, 2025년 9월 56큐비트 시스템 H2로 양자볼륨 33,554,432, 즉 2의 25승이라는 세계 기록을 세웠다. 돈을 내도 접근이 제한적인 최상급 이온트랩 양자컴퓨터로 꼽힌다. 비드래프트는 이번에 이 플랫폼을 평가용 할당량 범위에서 이용하고, 퀀티넘 기술진의 온보딩과 기술지원을 받는다.&lt;/p&gt;

&lt;h2&gt;
  
  
  비드래프트는 무엇으로 검토를 통과했나
&lt;/h2&gt;

&lt;p&gt;양자컴퓨팅 기업이 외부 연구팀에 플랫폼을 여는 기준은 단순하다. 실제 양자 하드웨어에서 결과를 낸 적이 있는가다. 비드래프트 양자 연구팀은 IBM 최신 양자 프로세서 헤론을 탑재한 실기(ibm_kingston)에서 대칭키 암호 구조 Even-Mansour의 키 복원 실험을 수행했다.&lt;/p&gt;

&lt;p&gt;기존에 공개된 실기 기록은 4비트(N=4) 수준이었다. 비드래프트는 이를 10비트(N=10)까지 끌어올렸고, 네 가지 암호 방식에 대해 다섯 종류의 실제 공격을 검증했다. 시뮬레이터가 아니라 노이즈가 있는 실제 큐비트에서 복원에 성공했다는 점이 핵심이다.&lt;/p&gt;

&lt;p&gt;이 논문은 미국 반도체 전문지 세미엔지니어링(SemiEngineering) 편집진이 고르는 주간 보안 연구논문 리뷰에 메타, 구글, 네덜란드 라드바우드대, 이탈리아 밀라노공대 연구와 함께 선정됐다. 회사가 홍보한 것이 아니라 해외 전문지 편집진이 직접 골라 실은 사례다.&lt;/p&gt;

&lt;h2&gt;
  
  
  AI로 양자 난제를 푸는 Δ-Engine은 어떻게 동작하나
&lt;/h2&gt;

&lt;p&gt;비드래프트는 양자컴퓨터를 직접 쓰는 것과 별개로, AI로 양자 문제를 푸는 기술을 개발한다. 강상관 양자 솔버 Δ-Engine은 고온초전도의 표준 모형인 2차원 허바드(Hubbard) 모형을 슈퍼컴퓨터나 양자컴퓨터 없이 GPU 한 장으로 검증한다.&lt;/p&gt;

&lt;p&gt;구조는 두 단계다. 먼저 신경망 양자상태(Neural Quantum State, NQS)로 정밀한 기준값을 만든다. 그다음 값싼 근사 계산의 오차를 AI가 보정한다. 비싼 정밀 계산과 싼 근사 계산의 차이(델타)를 학습해 메우는 방식이라 이름이 Δ-Engine이다. 6x6 격자까지 신뢰 등급을 매겨 인증했다.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="c1"&gt;# 개념 수준 의사코드 (illustrative)
&lt;/span&gt;&lt;span class="n"&gt;e_cheap&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;cheap_solver&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;lattice&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;        &lt;span class="c1"&gt;# 값싼 근사
&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;   &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;ai_correction&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;lattice&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;       &lt;span class="c1"&gt;# AI가 학습한 오차 보정
&lt;/span&gt;&lt;span class="n"&gt;e_final&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;e_cheap&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="n"&gt;delta&lt;/span&gt;              &lt;span class="c1"&gt;# NQS 기준값에 맞춘 추정
&lt;/span&gt;&lt;span class="n"&gt;grade&lt;/span&gt;   &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;certify&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;e_final&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;nqs_ref&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;    &lt;span class="c1"&gt;# 6x6까지 신뢰 등급 부여
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  거시와 미시를 하나로: 양자 로드맵
&lt;/h2&gt;

&lt;p&gt;비드래프트는 AI(두뇌), 양자(미시 세계), 피지컬 AI(거시 세계)를 세 축으로 삼는다. 허깅페이스 공식 리더보드 10개 부문 1위 Darwin-180B-RSI로 대표되는 AI 역량에, 물질과 분자를 원리 수준에서 다루는 양자 기술을 결합해 신약, 신소재, 물리 문제를 푸는 것이 목표다.&lt;/p&gt;

&lt;p&gt;이번 선정으로 IBM에 이어 세계 최고 성능의 이온트랩 양자컴퓨터까지 연구 범위가 넓어졌다. 이 밖에 양자 오류정정(QEC) 연구, 신소재 시뮬레이션 플랫폼 MaterialsOS, 암호의 양자 공격 저항성을 평가하는 진단 기술도 이어 가고 있다.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Q1. 양자볼륨 2의 25승이 어느 정도 수준인가?&lt;/strong&gt;&lt;br&gt;
양자볼륨은 2의 거듭제곱으로 커지므로 지수가 1 오를 때마다 난도가 두 배가 된다. 2의 25승은 2021년 1위 수준(약 2의 10승대)에서 자릿수가 크게 벌어진 기록으로, 현재 공개된 최상급이다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q2. IBM 실기 실험은 암호를 실제로 깼다는 뜻인가?&lt;/strong&gt;&lt;br&gt;
실전에 쓰이는 암호를 깬 것이 아니라, Even-Mansour 구조에 대해 실제 양자 하드웨어에서 키 복원이 가능함을 N=10 규모까지 검증한 것이다. 평가와 저항성 분석이 목적이다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q3. Δ-Engine은 양자컴퓨터 없이도 신뢰할 수 있나?&lt;/strong&gt;&lt;br&gt;
NQS 기준값과 대조해 6x6 격자까지 신뢰 등급을 매겨 인증했다. 양자컴퓨터나 슈퍼컴퓨터가 아니라 단일 GPU에서 돌아간다는 점이 강점이다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q4. 퀀티넘 Nexus와 H-Series에서 무엇을 할 계획인가?&lt;/strong&gt;&lt;br&gt;
평가용 할당량 범위에서 플랫폼을 이용하며, IBM 실기에서 쌓은 암호분석 경험과 AI 양자 솔버 기술을 이온트랩 환경에서 확장한다. 결과는 퀀티넘과의 협의 절차에 따라 순차 공개한다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q5. 이 발표의 출처는?&lt;/strong&gt;&lt;br&gt;
퀀티넘 양자볼륨 세계 기록은 Quantum Computing Report, 암호분석 논문 선정은 미국 SemiEngineering 주간 리뷰 기준이다.&lt;/p&gt;

&lt;h2&gt;
  
  
  Further reading
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;허깅페이스 공인 1위 10개와 무토큰 판정 ZTC: 시험 잘 보는 AI에서 일 잘하는 AI로&lt;/li&gt;
&lt;li&gt;허깅페이스 리더보드 1위 9개: 오픈소스 LLM Darwin-180B-RSI와 재귀적 자가개선(RSI) 개발자 가이드&lt;/li&gt;
&lt;/ul&gt;

</description>
      <category>ai</category>
      <category>quantum</category>
      <category>llm</category>
      <category>research</category>
    </item>
    <item>
      <title>허깅페이스 공인 1위 10개와 무토큰 판정 ZTC: 시험 잘 보는 AI에서 일 잘하는 AI로</title>
      <dc:creator>Vidraft_lab</dc:creator>
      <pubDate>Tue, 06 Oct 2026 00:42:31 +0000</pubDate>
      <link>https://dev.to/vidraft_lab/heogingpeiseu-gongin-1wi-10gaewa-mutokeun-panjeong-ztc-siheom-jal-boneun-aieseo-il-jalhaneun-airo-2833</link>
      <guid>https://dev.to/vidraft_lab/heogingpeiseu-gongin-1wi-10gaewa-mutokeun-panjeong-ztc-siheom-jal-boneun-aieseo-il-jalhaneun-airo-2833</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;비드래프트가 허깅페이스 공인 리더보드에서 1위를 추가해 총 &lt;strong&gt;10개 부문 1위&lt;/strong&gt;에 올랐다. 공인 벤치마크 48개, 95개 조직이 겨루는 무대에서 가장 많은 1위이고, 2위 지푸AI(4개)의 두 배가 넘는다.&lt;/li&gt;
&lt;li&gt;새로 추가된 두 부문은 '시험'이 아니라 '실무'다. 형식 준수를 재는 &lt;strong&gt;IFStruct 98.95%&lt;/strong&gt;, 문서 정보 추출을 재는 &lt;strong&gt;ExtractBench 90.29점&lt;/strong&gt;으로 둘 다 1위.&lt;/li&gt;
&lt;li&gt;AI 에이전트의 행동을 실행 전에 판정하는 &lt;strong&gt;ZTC(무토큰 확신도)&lt;/strong&gt;는 외부 API 판정(JEV)과 같은 정확도(AUC 0.7289 vs 0.7350)에, 판정 1회 0.06초로 약 10배 빠르다.&lt;/li&gt;
&lt;li&gt;Darwin-180B-RSI는 알리바바 Qwen3.8-Flash-Next를 '모델 수준 재귀적 자가개선(Model-level RSI)'으로 끌어올린 오픈 모델이다.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  10개 부문 1위가 왜 중요한가?
&lt;/h2&gt;

&lt;p&gt;허깅페이스 공인 리더보드는 각 제작사가 공식 평가 도구로 측정한 값을 등록하는 무대다. 비드래프트가 1위를 지키는 10개 부문은 '시험' 영역과 '실무' 영역을 모두 가로지른다.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;영역&lt;/th&gt;
&lt;th&gt;벤치마크&lt;/th&gt;
&lt;th&gt;점수&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;과학·지식&lt;/td&gt;
&lt;td&gt;GPQA Diamond&lt;/td&gt;
&lt;td&gt;94.44&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;과학·지식&lt;/td&gt;
&lt;td&gt;MMLU-Pro&lt;/td&gt;
&lt;td&gt;88.12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;수학&lt;/td&gt;
&lt;td&gt;AIME 2026&lt;/td&gt;
&lt;td&gt;100&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;수학&lt;/td&gt;
&lt;td&gt;HMMT 2026&lt;/td&gt;
&lt;td&gt;100&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;시각 추론&lt;/td&gt;
&lt;td&gt;MMMU-Pro&lt;/td&gt;
&lt;td&gt;79.48&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;법률&lt;/td&gt;
&lt;td&gt;LEXam&lt;/td&gt;
&lt;td&gt;68.94&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;법률&lt;/td&gt;
&lt;td&gt;LEXam-hard&lt;/td&gt;
&lt;td&gt;45.72&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기업 실무&lt;/td&gt;
&lt;td&gt;ExtractBench&lt;/td&gt;
&lt;td&gt;90.29&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기업 실무&lt;/td&gt;
&lt;td&gt;IFStruct&lt;/td&gt;
&lt;td&gt;98.95&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;문서 파싱&lt;/td&gt;
&lt;td&gt;MDPBench&lt;/td&gt;
&lt;td&gt;83.65&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;참가 모델이 가장 많은 MMLU-Pro(141개)와 GPQA(111개)에서도 1위를 지키고 있어, 경쟁이 가장 치열한 무대와 실무 영역을 함께 아우른다. 1위 보유 상위 조직은 비드래프트 10, 지푸AI 4, 샤오미 3, 딥시크 3, 문샷AI 3 순이다.&lt;/p&gt;

&lt;h2&gt;
  
  
  새로 추가된 1위는 왜 '실무'인가?
&lt;/h2&gt;

&lt;p&gt;지금까지의 1위가 과학·수학·법률 같은 시험 영역이었다면, 이번 두 부문은 기업이 AI를 실제 업무에 투입할 때 가장 먼저 부딪히는 능력이다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;IFStruct 98.95%.&lt;/strong&gt; 리퀴드AI(Liquid AI)가 만든 IFStruct는 AI가 요청받은 형식(JSON·YAML) 그대로 데이터를 만들어 내는지를 본다. 항목 개수, 필드 이름, 자료형, 허용값, 숫자 범위까지 조건을 하나라도 어기거나, 요청하지 않은 항목을 하나라도 지어내면 불합격이다. 비드래프트 모델은 2,000문항 가운데 1,979문항을 통과해 98.95%를 기록했다. 종전 1위 Agents-A1(93.25%), 오픈AI gpt-oss-20b(91.95%), 엔비디아 Nemotron-3-Nano(86.80%)를 큰 차이로 앞섰다.&lt;/p&gt;

&lt;p&gt;AI의 출력을 프로그램이 곧바로 읽어 다음 단계로 넘기는 파이프라인에서는 형식이 한 글자만 틀려도 업무가 멈춘다. 아래처럼 스키마 검증을 바로 통과해야 쓸 수 있다.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;jsonschema&lt;/span&gt;

&lt;span class="n"&gt;schema&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;object&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;properties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;name&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;string&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;age&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;integer&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}},&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;required&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;name&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;age&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;additionalProperties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="bp"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;  &lt;span class="c1"&gt;# 요청 안 한 항목을 지어내면 불합격
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;

&lt;span class="n"&gt;out&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;generate&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;prompt&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;          &lt;span class="c1"&gt;# 모델 출력
&lt;/span&gt;&lt;span class="n"&gt;jsonschema&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;validate&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;loads&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;out&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;schema&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;  &lt;span class="c1"&gt;# 한 글자만 틀려도 예외
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;&lt;strong&gt;ExtractBench 90.29점.&lt;/strong&gt; 라마인덱스(LlamaIndex)가 만든 ExtractBench는 수 쪽에서 190여 쪽에 이르는 PDF 370건에서 필요한 정보를 정확히 뽑아내는 능력을 잰다. 자가개선을 한 번 더 거친 Darwin-180B-RSI-R3가 90.29점으로 1위에 올랐다. 종전 1위는 이 모델의 기반인 알리바바 Qwen3.8-Flash-Next(89.88점)였다.&lt;/p&gt;

&lt;h2&gt;
  
  
  스스로 배우는 AI, RSI는 어떻게 동작하나?
&lt;/h2&gt;

&lt;p&gt;Darwin-180B-RSI는 알리바바의 오픈 모델 Qwen3.8-Flash-Next를 기반으로, 비드래프트의 '모델 수준 재귀적 자가개선(Model-level RSI)' 기술로 성능을 끌어올렸다. 핵심은 세 단계다.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;모델이 검증 가능한 문제를 스스로 푼다.&lt;/li&gt;
&lt;li&gt;정답으로 확인된 자기 풀이만 골라낸다.&lt;/li&gt;
&lt;li&gt;그 풀이만으로 다시 학습한다.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;사람이 쓴 정답이나 풀이가 필요 없고, 검증되지 않은 풀이는 배우지 않아 오류가 강화되지 않는다. 법률이나 문서 추출을 따로 가르치지 않았는데도 이 영역에서 1위에 오른 것은, 검증 가능한 문제를 풀며 익힌 꼼꼼한 추론 습관이 다른 영역으로 옮겨 간 결과로 회사는 보고 있다.&lt;/p&gt;

&lt;h2&gt;
  
  
  ZTC는 어떻게 한 글자도 만들지 않고 판정하나?
&lt;/h2&gt;

&lt;p&gt;AI 에이전트가 사람 대신 메일을 보내고 결제를 하고 코드를 실행하는 시대가 되면서, 틀린 행동을 실행 전에 걸러내는 '판정(decision)' 기술이 새 격전지가 됐다. 통상 방식은 다른 AI에게 "이 답이 맞느냐"를 물어 글로 된 답을 받는다. ZTC(Zero-Token Confidence, 무토큰 확신도)는 다르다. 답을 만든 모델의 내부 상태를 한 번 읽어 정답일 확률을 계산한다. 추가로 생성하는 글자가 0개다.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;같은 정확도, 10배 빠른 속도.&lt;/strong&gt; 판정 정확도(AUC)는 ZTC 0.7289, JEV 0.7350으로 통계적으로 같은 수준이다. 판정 1회 시간은 ZTC 0.06초, JEV 0.59초다. 같은 300초 동안 ZTC는 177건, JEV는 135건을 처리했고, 2,000판 대결에서 ZTC가 73.7%를 이겼다.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;데이터가 밖으로 나가지 않는다.&lt;/strong&gt; ZTC는 모델 옆 GPU에서 바로 돌아 외부 API를 왕복하지 않는다. 인터넷이 차단된 폐쇄망에서도 작동해 국방·금융·공공 현장에 적합하다.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;추가 비용이 거의 없다.&lt;/strong&gt; 이미 답을 만든 모델의 내부를 읽기만 한다. Darwin-397B-ZTC는 이 방식으로 자기 답의 정답 여부 판정 정확도를 0.76에서 0.88로 끌어올렸다.&lt;/li&gt;
&lt;/ul&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;지표&lt;/th&gt;
&lt;th&gt;플레인&lt;/th&gt;
&lt;th&gt;JEV(외부 API)&lt;/th&gt;
&lt;th&gt;ZTC(비드래프트)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;판정 정확도(AUC)&lt;/td&gt;
&lt;td&gt;없음&lt;/td&gt;
&lt;td&gt;0.7350&lt;/td&gt;
&lt;td&gt;0.7289&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;판정 1회 시간&lt;/td&gt;
&lt;td&gt;0초&lt;/td&gt;
&lt;td&gt;0.591초&lt;/td&gt;
&lt;td&gt;0.0615초&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;300초 처리 건수&lt;/td&gt;
&lt;td&gt;해당 없음&lt;/td&gt;
&lt;td&gt;135건&lt;/td&gt;
&lt;td&gt;177건&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;같은 시기, AI 에이전트의 행동을 판정하는 비드래프트의 체험 앱 Gate Arcade는 허깅페이스 '이주의 스페이스(Spaces of the Week)'에 선정됐다. 약 150만 개 앱 가운데 매주 8개를 고르는 큐레이션으로, 비드래프트는 한 달 새 두 번째로 이름을 올렸다.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Q1. 리더보드 점수는 누가 측정하나?&lt;/strong&gt;&lt;br&gt;
각 제작사가 공식 평가 도구로 측정해 등록한 값이다. 허깅페이스 공인 벤치마크는 측정 방법과 데이터가 공개돼 재현할 수 있다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q2. IFStruct에서 '불합격' 기준은 무엇인가?&lt;/strong&gt;&lt;br&gt;
항목 개수, 필드 이름, 자료형, 허용값, 숫자 범위 중 하나라도 어기거나, 요청하지 않은 항목을 하나라도 지어내면 불합격이다. 2,000문항 중 1,979문항 통과가 98.95%다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q3. ZTC와 JEV의 정확도 차이는 유의미한가?&lt;/strong&gt;&lt;br&gt;
AUC 0.7289 대 0.7350은 통계적으로 같은 수준이다. 대신 판정 1회 시간이 0.06초 대 0.59초로 약 10배 빠르다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q4. ZTC는 폐쇄망에서도 쓸 수 있나?&lt;/strong&gt;&lt;br&gt;
그렇다. 모델 옆 GPU에서 바로 돌아 외부 API 왕복이 없으므로 인터넷이 차단된 환경에서도 작동한다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q5. RSI는 학습을 거듭하면 오류가 쌓이지 않나?&lt;/strong&gt;&lt;br&gt;
정답으로 검증된 자기 풀이만 다시 학습하므로, 검증되지 않은 풀이는 반영되지 않아 오류가 강화되지 않는다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q6. 모델은 어디서 볼 수 있나?&lt;/strong&gt;&lt;br&gt;
huggingface.co/FINAL-Bench/Darwin-180B-RSI 와 huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3 에 공개돼 있다.&lt;/p&gt;

&lt;h2&gt;
  
  
  Further reading
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;&lt;a href="https://dev.to/taebong_kim_87fd72f718998"&gt;허깅페이스 리더보드 1위 9개: Darwin-180B-RSI와 재귀적 자가개선(RSI) 개발자 가이드&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>opensource</category>
      <category>huggingface</category>
    </item>
    <item>
      <title>허깅페이스 리더보드 1위 9개: 오픈소스 LLM Darwin-180B-RSI와 재귀적 자가개선(RSI) 개발자 가이드</title>
      <dc:creator>Vidraft_lab</dc:creator>
      <pubDate>Mon, 05 Oct 2026 08:58:20 +0000</pubDate>
      <link>https://dev.to/vidraft_lab/heogingpeiseu-rideobodeu-1wi-9gae-opeunsoseu-llm-darwin-180b-rsiwa-jaegwijeog-jagagaeseonrsi-gaebalja-gaideu-gan</link>
      <guid>https://dev.to/vidraft_lab/heogingpeiseu-rideobodeu-1wi-9gae-opeunsoseu-llm-darwin-180b-rsiwa-jaegwijeog-jagagaeseonrsi-gaebalja-gaideu-gan</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;비드래프트(VIDRAFT)의 오픈소스 LLM &lt;strong&gt;Darwin-180B-RSI&lt;/strong&gt; 계열이 허깅페이스 공인(official) 벤치마크 48개 중 &lt;strong&gt;9개에서 1위&lt;/strong&gt;입니다. 95개 조직 가운데 가장 많고, 다음은 문샷AI·지푸AI(각 4개)입니다.&lt;/li&gt;
&lt;li&gt;새로 추가된 1위는 실무형 두 개입니다. &lt;strong&gt;IFStruct 98.95%&lt;/strong&gt;(구조화 출력, 2,000문항 중 1,979 통과)와 &lt;strong&gt;ExtractBench 90.29&lt;/strong&gt;(PDF 370건 정보 추출, R3 버전)입니다.&lt;/li&gt;
&lt;li&gt;비결은 &lt;strong&gt;모델 수준 재귀적 자가개선(Model-level RSI)&lt;/strong&gt;: 사람이 쓴 정답 없이 검증 가능한 문제를 스스로 풀고, 정답으로 확인된 자기 풀이만 골라 다시 학습합니다.&lt;/li&gt;
&lt;li&gt;같은 팀의 &lt;strong&gt;ZTC&lt;/strong&gt;는 답을 한 글자도 생성하지 않고 판정합니다. 외부 API 판정(JEV)과 정확도는 통계적으로 같고(AUC 0.7289 vs 0.7350), 판정 1회는 0.0615초 vs 0.591초로 약 10배 빠릅니다.&lt;/li&gt;
&lt;li&gt;아래에 리더보드를 직접 조회하는 Python 코드, vLLM·Transformers 실행 코드, FAQ를 정리했습니다. 모든 리더보드 수치는 2026년 10월 5일 허깅페이스 API로 다시 확인했습니다.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522VIDRAFT%2522%252C%2522Moonshot%2520AI%2522%252C%2522Zhipu%2520AI%2520%2528Z.ai%2529%2522%252C%2522DeepSeek%2522%252C%2522Xiaomi%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B9%252C4%252C4%252C3%252C3%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522%25EC%25A1%25B0%25EC%25A7%2581%25EB%25B3%2584%2520%25EA%25B3%25B5%25EC%259D%25B8%2520%25EB%25A6%25AC%25EB%258D%2594%25EB%25B3%25B4%25EB%2593%259C%25201%25EC%259C%2584%2520%25EC%2588%2598%2520%25282026-10-05%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522VIDRAFT%2522%252C%2522Moonshot%2520AI%2522%252C%2522Zhipu%2520AI%2520%2528Z.ai%2529%2522%252C%2522DeepSeek%2522%252C%2522Xiaomi%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B9%252C4%252C4%252C3%252C3%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522%25EC%25A1%25B0%25EC%25A7%2581%25EB%25B3%2584%2520%25EA%25B3%25B5%25EC%259D%25B8%2520%25EB%25A6%25AC%25EB%258D%2594%25EB%25B3%25B4%25EB%2593%259C%25201%25EC%259C%2584%2520%25EC%2588%2598%2520%25282026-10-05%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="조직별 허깅페이스 공인 리더보드 1위 수" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  허깅페이스 공인 리더보드 1위 9개는 정확히 무엇인가요?
&lt;/h2&gt;

&lt;p&gt;허깅페이스는 일부 데이터셋을 "공인 벤치마크(benchmark:official)"로 지정하고, 각 데이터셋 페이지에 리더보드를 붙여 둡니다. 모델 제작자는 자기 모델 저장소에 &lt;code&gt;.eval_results/*.yaml&lt;/code&gt; 파일로 점수를 등록하고, 허깅페이스가 이를 모아 순위를 매깁니다. 현재 공인 벤치마크는 48개, 참가 조직은 95개입니다.&lt;/p&gt;

&lt;p&gt;2026년 10월 5일 API 기준 Darwin-180B-RSI 계열이 1위인 9개 보드와 바로 아래 모델은 다음과 같습니다.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;영역&lt;/th&gt;
&lt;th&gt;벤치마크 (데이터셋 ID)&lt;/th&gt;
&lt;th&gt;Darwin 점수&lt;/th&gt;
&lt;th&gt;2위 모델&lt;/th&gt;
&lt;th&gt;2위 점수&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;과학&lt;/td&gt;
&lt;td&gt;GPQA Diamond (&lt;code&gt;Idavidrein/gpqa&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;94.44&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K3&lt;/td&gt;
&lt;td&gt;93.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;지식&lt;/td&gt;
&lt;td&gt;MMLU-Pro (&lt;code&gt;TIGER-Lab/MMLU-Pro&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;88.12&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;MiniMaxAI/MiniMax-M2.1&lt;/td&gt;
&lt;td&gt;88.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;수학&lt;/td&gt;
&lt;td&gt;AIME 2026 (&lt;code&gt;MathArena/aime_2026&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;thinkingmachines/Inkling&lt;/td&gt;
&lt;td&gt;97.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;수학&lt;/td&gt;
&lt;td&gt;HMMT Feb 2026 (&lt;code&gt;MathArena/hmmt_feb_2026&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K2.6&lt;/td&gt;
&lt;td&gt;92.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;시각 추론&lt;/td&gt;
&lt;td&gt;MMMU-Pro (&lt;code&gt;MMMU/MMMU_Pro&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.48&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K2.6&lt;/td&gt;
&lt;td&gt;79.4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;법률&lt;/td&gt;
&lt;td&gt;LEXam (&lt;code&gt;LEXam-Benchmark/LEXam&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68.94&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;deepseek-ai/DeepSeek-R1&lt;/td&gt;
&lt;td&gt;52.41&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;법률&lt;/td&gt;
&lt;td&gt;LEXam-hard (&lt;code&gt;joelniklaus/LEXam-hard&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;45.72&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;thinkingmachines/Inkling&lt;/td&gt;
&lt;td&gt;40.82&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기업 실무&lt;/td&gt;
&lt;td&gt;ExtractBench (&lt;code&gt;llamaindex/ExtractBench&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;
&lt;strong&gt;90.29&lt;/strong&gt; (R3)&lt;/td&gt;
&lt;td&gt;Qwen/Qwen3.8-Flash-Next&lt;/td&gt;
&lt;td&gt;89.88&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기업 실무&lt;/td&gt;
&lt;td&gt;IFStruct (&lt;code&gt;LiquidAI/ifstruct-v1.0&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.95&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;InternScience/Agents-A1&lt;/td&gt;
&lt;td&gt;93.25&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;참가 모델이 가장 많은 MMLU-Pro(약 141개)와 GPQA(약 111개)에서도 1위입니다. 경쟁이 가장 붐비는 보드와 실무형 보드를 함께 잡았다는 점이 개발자 입장에서 의미 있는 부분입니다.&lt;/p&gt;

&lt;p&gt;정직하게 덧붙이면, 이 점수들은 모두 제작사가 공식 평가 도구로 측정해 등록한 &lt;strong&gt;자체 측정값&lt;/strong&gt;입니다. 다수결 점수(예: AIME maj@16, GPQA 최대 16샘플 다수결)는 모델 카드에 그렇게 표기되어 있습니다. 숫자를 비교할 때 설정까지 같이 보시길 권합니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  리더보드 순위를 코드로 직접 확인하려면 어떻게 하나요?
&lt;/h2&gt;

&lt;p&gt;블로그 글의 숫자를 믿을 필요 없이, 허깅페이스 공개 API로 바로 확인할 수 있습니다. 토큰도 필요 없습니다.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;collections&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;Counter&lt;/span&gt;

&lt;span class="n"&gt;API&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://huggingface.co/api&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;

&lt;span class="c1"&gt;# 1) 공인 벤치마크 목록
&lt;/span&gt;&lt;span class="n"&gt;boards&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;API&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                      &lt;span class="n"&gt;params&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;filter&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;benchmark:official&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;limit&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;200&lt;/span&gt;&lt;span class="p"&gt;}).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;공인 벤치마크 수:&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;boards&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

&lt;span class="c1"&gt;# 2) 보드별 1위 집계
&lt;/span&gt;&lt;span class="n"&gt;firsts&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;Counter&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;boards&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;rows&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;API&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets/&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;id&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/leaderboard&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="nf"&gt;isinstance&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;list&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;continue&lt;/span&gt;
    &lt;span class="n"&gt;top&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;                      &lt;span class="c1"&gt;# rank 1
&lt;/span&gt;    &lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;split&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]]&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;startswith&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="n"&gt;r2&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt; &lt;span class="k"&gt;else&lt;/span&gt; &lt;span class="p"&gt;{}&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;id&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
              &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;| 2위&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;r2&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;r2&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;most_common&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="c1"&gt;# 2026-10-05 실행 결과: FINAL-Bench 9, moonshotai 4, zai-org 4, XiaomiMiMo 3, deepseek-ai 3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;각 행에는 &lt;code&gt;rank&lt;/code&gt;, &lt;code&gt;value&lt;/code&gt;, &lt;code&gt;modelId&lt;/code&gt;, &lt;code&gt;source&lt;/code&gt;(모델 카드 링크), &lt;code&gt;verified&lt;/code&gt; 같은 필드가 들어 있습니다. 사내 모델 선정 대시보드를 만들거나, 특정 벤치마크의 1위 변동을 주기적으로 감시하는 데 그대로 쓸 수 있습니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  IFStruct 98.95%는 개발자에게 왜 중요한가요?
&lt;/h2&gt;

&lt;p&gt;IFStruct는 미국 리퀴드AI(Liquid AI)가 만든 구조화 출력 벤치마크입니다. 실제 사용자가 요청하는 다양한 표현으로 JSON 또는 YAML 스키마를 지정하고, 모델이 그대로 지키는지 문항마다 합격/불합격으로 채점합니다. 기준이 꽤 엄격합니다.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;항목 개수(또는 범위), 감싸는 키, JSON과 YAML 구분&lt;/li&gt;
&lt;li&gt;코드 펜스를 요구하거나 금지하는 조건, "설명 없이"라는 요청&lt;/li&gt;
&lt;li&gt;모든 필드의 자료형, 허용값(enum), 숫자 범위, 중첩 리스트 길이&lt;/li&gt;
&lt;li&gt;스키마가 요구하지 않은 필드를 하나라도 지어내면 불합격&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;제약 디코딩(constrained decoding)을 쓰지 않으므로 모델 자체의 규율만 측정됩니다. Darwin-180B-RSI는 공식 하네스 기본값(temperature 0, 최대 16,000토큰, 생각 켬)으로 2,000문항 중 1,979문항을 통과했습니다. 한 문항은 하네스의 120초 읽기 시간 제한에 걸려 불합격 처리되었으니, 이 숫자는 보수적인 값입니다. 같은 모델에서 생각 모드를 끄면 89.7%로 내려갑니다. 마지막 몇 개의 제약 위반을 잡아내는 것이 바로 추론 단계라는 뜻입니다.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522horizontalBar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Darwin-180B-RSI%2522%252C%2522Agents-A1%2522%252C%2522gpt-oss-20b%2522%252C%2522Nemotron-3-Nano-30B%2522%252C%2522Granite%25204.1%25208B%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B98.95%252C93.25%252C91.95%252C86.8%252C68.45%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522IFStruct%2520%25EA%25B5%25AC%25EC%25A1%25B0%25ED%2599%2594%2520%25EC%25B6%259C%25EB%25A0%25A5%2520%25EC%25A0%2595%25ED%2599%2595%25EB%258F%2584%2520%2528%2525%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522horizontalBar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Darwin-180B-RSI%2522%252C%2522Agents-A1%2522%252C%2522gpt-oss-20b%2522%252C%2522Nemotron-3-Nano-30B%2522%252C%2522Granite%25204.1%25208B%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B98.95%252C93.25%252C91.95%252C86.8%252C68.45%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522IFStruct%2520%25EA%25B5%25AC%25EC%25A1%25B0%25ED%2599%2594%2520%25EC%25B6%259C%25EB%25A0%25A5%2520%25EC%25A0%2595%25ED%2599%2595%25EB%258F%2584%2520%2528%2525%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="IFStruct 순위" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;에이전트 파이프라인이나 백오피스 자동화에서 모델의 출력은 사람이 아니라 코드가 읽습니다. 자료형 하나, 지어낸 키 하나에 &lt;code&gt;json.loads&lt;/code&gt;나 스키마 검증이 실패하고 파이프라인이 멈춥니다. 재시도 루프와 수리(repair) 로직을 줄일 수 있다는 점에서, 98.95%와 93.25%의 차이는 운영 비용의 차이입니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  ExtractBench 90.29는 어떻게 나왔나요?
&lt;/h2&gt;

&lt;p&gt;ExtractBench는 라마인덱스(LlamaIndex)가 만든 문서 정보 추출 벤치마크입니다. 몇 쪽짜리 서식부터 190여 쪽에 이르는 파일까지 PDF 370건에서 구조화된 필드를 뽑아야 합니다. 자가개선을 한 번 더 거친 &lt;strong&gt;Darwin-180B-RSI-R3&lt;/strong&gt;가 90.29점으로 1위에 올랐고, 종전 1위는 이 모델의 기반인 알리바바 Qwen3.8-Flash-Next(89.88), 그다음은 Qwen3.8-27B(89.75)입니다. 이 실행은 공식 하네스로 생각 모드를 끈 상태였고, 제출 노트에 그렇게 명시했습니다.&lt;/p&gt;

&lt;p&gt;기반 모델을 자기 계보의 다음 세대가 넘었다는 점이 RSI의 효과를 가장 직접적으로 보여 줍니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  재귀적 자가개선(Model-level RSI)은 어떻게 작동하나요?
&lt;/h2&gt;

&lt;p&gt;Darwin-180B-RSI는 알리바바의 오픈 모델 &lt;strong&gt;Qwen3.8-Flash-Next&lt;/strong&gt;에서 출발합니다. 그 위에 비드래프트의 &lt;strong&gt;모델 수준 재귀적 자가개선(Model-level RSI)&lt;/strong&gt;을 적용했습니다. 원리는 세 줄로 요약됩니다.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;모델이 &lt;strong&gt;검증 가능한 문제&lt;/strong&gt;를 스스로 풉니다.&lt;/li&gt;
&lt;li&gt;풀이 중 &lt;strong&gt;정답으로 확인된 자기 풀이만&lt;/strong&gt; 남깁니다.&lt;/li&gt;
&lt;li&gt;그 풀이로 &lt;strong&gt;다시 학습&lt;/strong&gt;하고, 이 과정을 반복합니다.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;사람이 쓴 정답 풀이나 추론 흔적은 쓰지 않습니다. 검증되지 않은 풀이는 학습 데이터에 들어가지 않기 때문에, 모델이 자기 오류를 강화하는 일이 구조적으로 막힙니다. R3는 이 반복을 한 바퀴 더 돈 결과입니다.&lt;/p&gt;

&lt;p&gt;흥미로운 점은 법률이나 문서 추출을 따로 가르치지 않았는데도 LEXam, LEXam-hard, ExtractBench에서 1위가 나왔다는 것입니다. 회사는 검증 가능한 문제를 풀며 익힌 꼼꼼한 단계별 추론 습관이 다른 영역으로 옮겨 간 결과로 보고 있습니다.&lt;/p&gt;

&lt;p&gt;"Model-level"이라는 이름은 작업틀(하네스) 쪽 프롬프트나 도구를 고치는 방식과 구분하기 위한 것입니다. 바뀌는 것은 매뉴얼이 아니라 모델의 가중치, 즉 두뇌 자체입니다.&lt;/p&gt;

&lt;h2&gt;
  
  
  Darwin-180B-RSI를 직접 실행하려면 어떻게 하나요?
&lt;/h2&gt;

&lt;p&gt;아래 코드는 &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI" rel="noopener noreferrer"&gt;모델 카드&lt;/a&gt;의 Quickstart를 그대로 옮긴 것입니다. 사양을 먼저 확인하세요.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;구조: Mixture-of-Experts, 하이브리드 어텐션(선형 어텐션 36층 + 완전 어텐션 12층)&lt;/li&gt;
&lt;li&gt;전문가 512개 중 토큰당 10개 활성 + 공유 전문가&lt;/li&gt;
&lt;li&gt;컨텍스트 262,144토큰, 이미지+텍스트 입력, 텍스트 출력&lt;/li&gt;
&lt;li&gt;bf16 기준 약 336GB&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  vLLM으로 서빙 (B200 8장 또는 동급)
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;vllm serve FINAL-Bench/Darwin-180B-RSI &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--tensor-parallel-size&lt;/span&gt; 8 &lt;span class="nt"&gt;--enable-expert-parallel&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--max-model-len&lt;/span&gt; 135168 &lt;span class="nt"&gt;--trust-remote-code&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  OpenAI 호환 API로 호출
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="n"&gt;c&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;http://localhost:8000/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;-&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;r&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;c&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/Darwin-180B-RSI&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explain why the sky is blue in two sentences.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;1.0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;top_p&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.95&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;extra_body&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;top_k&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;20&lt;/span&gt;&lt;span class="p"&gt;})&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;r&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Transformers로 로드
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;transformers&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;AutoProcessor&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;AutoModelForImageTextToText&lt;/span&gt;
&lt;span class="n"&gt;model_id&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/Darwin-180B-RSI&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="n"&gt;processor&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;AutoProcessor&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;from_pretrained&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model_id&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;AutoModelForImageTextToText&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;from_pretrained&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model_id&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;torch_dtype&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;auto&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;device_map&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;auto&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;실전 팁 두 가지입니다. 첫째, 이것은 생각(thinking) 모델입니다. 어려운 추론에는 32K에서 131K토큰의 생각 예산을 권장하며, 짧게 자르면 정확도가 떨어집니다. 둘째, 모델 카드의 평가 설정은 temperature 1.0, top_p 0.95, top_k 20입니다. 다만 IFStruct처럼 형식이 중요한 작업은 공식 하네스가 temperature 0을 썼다는 점도 참고하세요.&lt;/p&gt;

&lt;h2&gt;
  
  
  ZTC는 무엇이고 JEV와 무엇이 다른가요?
&lt;/h2&gt;

&lt;p&gt;AI 에이전트가 메일을 보내고, 결제를 하고, 코드를 실행하는 시대에는 &lt;strong&gt;틀린 행동을 실행 전에 거르는 판정(decision)&lt;/strong&gt; 기술이 중요해졌습니다. 타입세이프(Typesafe)의 판정 API &lt;strong&gt;JEV&lt;/strong&gt;가 이 분야의 표준 규격을 만들었고, 이를 평가하는 Decision Index에는 70개가 넘는 모델이 올라 있습니다. 9월 30일에는 클라우드플레어가 JEV 호환 판정 모델 Clef를 공개했습니다.&lt;/p&gt;

&lt;p&gt;비드래프트의 &lt;strong&gt;ZTC(Zero-Token Confidence, 무토큰 확신도)&lt;/strong&gt;는 접근이 다릅니다. 다른 AI에게 "이 답이 맞나요?"를 물어 글로 된 답을 받는 대신, 답을 만든 모델의 내부 상태를 한 번 읽어 정답일 확률을 계산합니다. 추가로 생성하는 토큰이 0개입니다.&lt;/p&gt;

&lt;p&gt;이를 직접 보여 주는 앱이 &lt;strong&gt;Gate Arcade&lt;/strong&gt;이고, 9월 28일 주간 허깅페이스 "이주의 스페이스(Spaces of the Week)"에 선정되었습니다. 에이전트가 행동을 제안하면 관문이 실행 또는 보류를 정합니다. 맞는 행동 실행 +1, 틀린 행동 실행 -1, 보류 0점입니다. 2026년 9월 24일 기준, 폐쇄망 배치 실측값은 다음과 같습니다.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;판정 없음&lt;/th&gt;
&lt;th&gt;JEV (외부 API)&lt;/th&gt;
&lt;th&gt;ZTC (비드래프트)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;판정 정확도 (AUC)&lt;/td&gt;
&lt;td&gt;없음&lt;/td&gt;
&lt;td&gt;0.7350&lt;/td&gt;
&lt;td&gt;0.7289&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;판정 1회 시간&lt;/td&gt;
&lt;td&gt;0초&lt;/td&gt;
&lt;td&gt;0.591초&lt;/td&gt;
&lt;td&gt;0.0615초&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;300초 처리 건수&lt;/td&gt;
&lt;td&gt;해당 없음&lt;/td&gt;
&lt;td&gt;135건&lt;/td&gt;
&lt;td&gt;177건&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522JEV%2520%2528%25EC%2599%25B8%25EB%25B6%2580%2520API%2529%2522%252C%2522ZTC%2520%2528%25EB%25B9%2584%25EB%2593%259C%25EB%259E%2598%25ED%2594%2584%25ED%258A%25B8%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B0.591%252C0.0615%255D%252C%2522backgroundColor%2522%253A%255B%2522%25239CA3AF%2522%252C%2522%25234F46E5%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522%25ED%258C%2590%25EC%25A0%2595%25201%25ED%259A%258C%2520%25EC%258B%259C%25EA%25B0%2584%2520%2528%25EC%25B4%2588%2529%252C%2520%25EB%2582%25AE%25EC%259D%2584%25EC%2588%2598%25EB%25A1%259D%2520%25EC%25A2%258B%25EC%259D%258C%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522JEV%2520%2528%25EC%2599%25B8%25EB%25B6%2580%2520API%2529%2522%252C%2522ZTC%2520%2528%25EB%25B9%2584%25EB%2593%259C%25EB%259E%2598%25ED%2594%2584%25ED%258A%25B8%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B0.591%252C0.0615%255D%252C%2522backgroundColor%2522%253A%255B%2522%25239CA3AF%2522%252C%2522%25234F46E5%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522%25ED%258C%2590%25EC%25A0%2595%25201%25ED%259A%258C%2520%25EC%258B%259C%25EA%25B0%2584%2520%2528%25EC%25B4%2588%2529%252C%2520%25EB%2582%25AE%25EC%259D%2584%25EC%2588%2598%25EB%25A1%259D%2520%25EC%25A2%258B%25EC%259D%258C%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="ZTC와 JEV 판정 시간 비교" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;정확도는 통계적으로 같은 수준이고 속도는 약 10배입니다. 2,000판 대결에서 ZTC가 73.7%를 이겼습니다. 판정을 위해 데이터를 밖으로 보낼 필요가 없어 인터넷이 막힌 폐쇄망에서도 돌아갑니다. 같은 방식으로 Darwin-397B-ZTC는 자기 답의 정답 여부 판정 정확도를 0.76에서 0.88로 끌어올렸습니다.&lt;/p&gt;

&lt;p&gt;한계도 분명합니다. 모델 내부를 읽어야 하므로 API로만 쓰는 폐쇄형 모델에는 적용할 수 없고, 모델마다 판독기를 맞춰야 합니다. 그래서 최종 판정자라기보다 빠르고 싼 1차 관문으로 쓰는 것이 맞습니다. 참고로 Darwin-180B-RSI 저장소에 함께 들어 있는 ZTC 판독기는 모델 카드에 "초기 공개(early release)"로 표기되어 있으니, 높은 위험의 행동에는 카드 설명을 확인하고 쓰세요.&lt;/p&gt;

&lt;h2&gt;
  
  
  자주 묻는 질문 (FAQ)
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Q1. 허깅페이스 리더보드 1위 9개는 어디서 확인하나요?&lt;/strong&gt;&lt;br&gt;
각 데이터셋 페이지(예: &lt;code&gt;huggingface.co/datasets/LiquidAI/ifstruct-v1.0&lt;/code&gt;)의 리더보드 탭이나, 위의 Python 코드처럼 &lt;code&gt;https://huggingface.co/api/datasets/{id}/leaderboard&lt;/code&gt;를 호출하면 됩니다. 48개 보드를 한 화면에 모은 스페이스도 있습니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q2. 점수는 누가 측정했나요? 검증된 값인가요?&lt;/strong&gt;&lt;br&gt;
허깅페이스 공인 리더보드는 제작사가 공식 평가 도구로 측정해 &lt;code&gt;.eval_results&lt;/code&gt;로 등록하는 구조입니다. Darwin의 점수도 자체 측정값이며, 샘플 수와 생각 예산 같은 설정을 모델 카드에 모두 공개했습니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q3. 재귀적 자가개선(RSI)에 사람이 만든 정답이 정말 전혀 안 들어가나요?&lt;/strong&gt;&lt;br&gt;
네. 모델이 검증 가능한 문제를 풀고, 정답으로 확인된 자기 풀이만 남겨 다시 학습합니다. 사람이 쓴 풀이나 추론 흔적은 쓰지 않습니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q4. 오픈소스 LLM으로 바로 써도 되나요? 하드웨어는 얼마나 필요한가요?&lt;/strong&gt;&lt;br&gt;
가중치는 허깅페이스에 공개되어 있습니다. bf16 기준 약 336GB이므로 모델 카드는 B200 8장(또는 동급)에서 vLLM 텐서 병렬 8, 전문가 병렬을 권장합니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q5. 구조화 출력(JSON) 작업에 왜 이 모델인가요?&lt;/strong&gt;&lt;br&gt;
제약 디코딩 없이 IFStruct 98.95%를 기록했습니다. 2위(93.25%)보다 5.7%p 높아, 출력 수리와 재시도 로직을 줄이는 데 유리합니다.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q6. ZTC를 우리 서비스에 붙이려면?&lt;/strong&gt;&lt;br&gt;
모델 내부 상태를 읽을 수 있는 오픈 웨이트 모델이어야 합니다. Gate Arcade에서 동작 방식을 먼저 체험해 보고, 모델 카드의 &lt;code&gt;ztc/&lt;/code&gt; 폴더 예제를 참고하세요.&lt;/p&gt;

&lt;h2&gt;
  
  
  링크
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;비드래프트: &lt;a href="https://vidraft.net" rel="noopener noreferrer"&gt;https://vidraft.net&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;모델: &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI" rel="noopener noreferrer"&gt;https://huggingface.co/FINAL-Bench/Darwin-180B-RSI&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;R3 (ExtractBench 1위): &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3" rel="noopener noreferrer"&gt;https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;Gate Arcade (이주의 스페이스): &lt;a href="https://huggingface.co/spaces/FINAL-Bench/gate-tetris" rel="noopener noreferrer"&gt;https://huggingface.co/spaces/FINAL-Bench/gate-tetris&lt;/a&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;시험을 잘 푸는 모델에서, 정해진 형식대로 일하는 모델로. 그리고 그 모델이 행동하기 전에 확신 없는 순간을 0.06초 만에 잡아내는 관문까지. 직접 돌려 보시고 결과를 댓글로 알려 주세요.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>opensource</category>
      <category>huggingface</category>
    </item>
  </channel>
</rss>
