<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: QuantID</title>
    <description>The latest articles on DEV Community by QuantID (@quantid).</description>
    <link>https://dev.to/quantid</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4163326%2Fde587e29-fab4-4ba1-ade8-eccf40edd030.png</url>
      <title>DEV Community: QuantID</title>
      <link>https://dev.to/quantid</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/quantid"/>
    <language>en</language>
    <item>
      <title>Who Leads Hugging Face's Official Benchmarks? Concentration, Gaps and Hidden Entries (Measured 2026-10-06)</title>
      <dc:creator>QuantID</dc:creator>
      <pubDate>Mon, 05 Oct 2026 08:57:14 +0000</pubDate>
      <link>https://dev.to/quantid/who-leads-hugging-faces-official-benchmarks-a-measurement-of-concentration-gaps-and-hidden-64k</link>
      <guid>https://dev.to/quantid/who-leads-hugging-faces-official-benchmarks-a-measurement-of-concentration-gaps-and-hidden-64k</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;p&gt;On 2026-10-06 we read every dataset tagged &lt;code&gt;benchmark:official&lt;/code&gt; from the public Hugging Face Hub API, and every leaderboard attached to those datasets, twice: once in the default view and once with &lt;code&gt;base_model=false&lt;/code&gt;. Every number below is a reading taken on that date, and about 40 lines of Python reproduce it.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;48&lt;/strong&gt; official benchmark datasets, &lt;strong&gt;44&lt;/strong&gt; with at least one leaderboard entry.&lt;/li&gt;
&lt;li&gt;Default view: &lt;strong&gt;1,024&lt;/strong&gt; entries from &lt;strong&gt;95&lt;/strong&gt; organizations across &lt;strong&gt;411&lt;/strong&gt; distinct models.&lt;/li&gt;
&lt;li&gt;The &lt;strong&gt;top 5&lt;/strong&gt; organizations hold &lt;strong&gt;40.3%&lt;/strong&gt; of visible entries, the &lt;strong&gt;top 10&lt;/strong&gt; hold &lt;strong&gt;59.0%&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Full population (with &lt;code&gt;base_model=false&lt;/code&gt;): &lt;strong&gt;1,479&lt;/strong&gt; entries, &lt;strong&gt;161&lt;/strong&gt; namespaces. &lt;strong&gt;Gini 0.709&lt;/strong&gt;, HHI 0.0369.&lt;/li&gt;
&lt;li&gt;Median relative gap between #1 and #2: &lt;strong&gt;3.69%&lt;/strong&gt;. On &lt;strong&gt;9 of 43&lt;/strong&gt; comparable boards the gap is under 1%.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;455 entries (30.8%)&lt;/strong&gt; never appear in the default view because the board hides models that declare a &lt;code&gt;base_model&lt;/code&gt;. &lt;strong&gt;34 of 44&lt;/strong&gt; boards are affected.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Many organizations take part, but entry counts are uneven. On about one board in five the top two are close enough that the order could flip on a rerun, and nearly a third of all submissions only show up if you change a query parameter.&lt;/p&gt;

&lt;h2&gt;
  
  
  Why measure benchmark leaderboards instead of ranking them?
&lt;/h2&gt;

&lt;p&gt;QuantID works on measurement and diagnostics, so we treat a leaderboard as an instrument rather than a scoreboard. A leaderboard is a fixed test, a scoring rule and a published ordering. Like any instrument it has a resolution, a bias and a display layer that can hide part of the signal. Most writing about leaderboards asks who is first. We ask four questions about the instrument itself:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;How many independent parties actually participate?&lt;/li&gt;
&lt;li&gt;How unequal is that participation?&lt;/li&gt;
&lt;li&gt;How far apart are the leaders, compared with plausible run-to-run noise?&lt;/li&gt;
&lt;li&gt;How much of the data is filtered away before a human sees it?&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Hugging Face lets model owners attach evaluation results to a model repository through &lt;code&gt;.eval_results/*.yaml&lt;/code&gt; files. Datasets tagged as official benchmarks collect those files into a board. The whole system answers to a public API, so it can be audited like any other measurement pipeline.&lt;/p&gt;

&lt;h2&gt;
  
  
  What data did we read?
&lt;/h2&gt;

&lt;p&gt;Three public calls, no authentication:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;GET https://huggingface.co/api/datasets?filter=benchmark:official&amp;amp;limit=200
GET https://huggingface.co/api/datasets/{id}/leaderboard
GET https://huggingface.co/api/datasets/{id}/leaderboard?base_model=false
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Each row carries &lt;code&gt;rank&lt;/code&gt;, &lt;code&gt;value&lt;/code&gt;, &lt;code&gt;modelId&lt;/code&gt;, &lt;code&gt;lower_is_better&lt;/code&gt;, a &lt;code&gt;source&lt;/code&gt; link and author metadata. We define the &lt;strong&gt;organization&lt;/strong&gt; of an entry as the namespace before the slash in &lt;code&gt;modelId&lt;/code&gt; (so &lt;code&gt;Qwen/Qwen3.8-Flash-Next&lt;/code&gt; belongs to &lt;code&gt;Qwen&lt;/code&gt;). User namespaces count as organizations. We do not merge related accounts: the API does not say which accounts belong together, and guessing would inject our own bias into the measurement.&lt;/p&gt;

&lt;p&gt;For each board, the larger of the two responses is the full population (in practice the &lt;code&gt;base_model=false&lt;/code&gt; response). The default response is the visible population.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Quantity&lt;/th&gt;
&lt;th&gt;Default view&lt;/th&gt;
&lt;th&gt;Full population&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Benchmark datasets&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Boards with entries&lt;/td&gt;
&lt;td&gt;44&lt;/td&gt;
&lt;td&gt;44&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entries&lt;/td&gt;
&lt;td&gt;1,024&lt;/td&gt;
&lt;td&gt;1,479&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Distinct models&lt;/td&gt;
&lt;td&gt;411&lt;/td&gt;
&lt;td&gt;647&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Distinct organizations&lt;/td&gt;
&lt;td&gt;95&lt;/td&gt;
&lt;td&gt;161&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;New YAML files are merged daily, so the boards keep changing. Treat every number here as a snapshot, not a constant.&lt;/p&gt;

&lt;h2&gt;
  
  
  How concentrated is AI benchmark participation?
&lt;/h2&gt;

&lt;p&gt;"Concentration" covers two separate questions: who submits, and who wins.&lt;/p&gt;

&lt;p&gt;In the default view the five largest submitters are Qwen (136), zai-org (84), deepseek-ai (65), moonshotai (65) and nvidia (63). Together those five hold &lt;strong&gt;40.3%&lt;/strong&gt; of the 1,024 visible entries, and the top ten hold &lt;strong&gt;59.0%&lt;/strong&gt;. Entry volume mostly tracks how many model sizes a lab ships; it says little about quality.&lt;/p&gt;

&lt;p&gt;Across the full population the inequality is easier to summarize with two numbers that seem to disagree:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Metric&lt;/th&gt;
&lt;th&gt;Value&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gini (entries by org)&lt;/td&gt;
&lt;td&gt;0.709&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;HHI&lt;/td&gt;
&lt;td&gt;0.0369&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Effective number of orgs (1/HHI)&lt;/td&gt;
&lt;td&gt;about 27&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Orgs appearing on exactly one board&lt;/td&gt;
&lt;td&gt;86 of 161&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;In antitrust terms an HHI of 0.0369 is unconcentrated (below 0.15) because no single organization holds a large slice; the largest, Qwen, has 190 of 1,479 entries (12.8%). A Gini of 0.709 says the distribution is still very unequal. The long tail explains both readings: more than half of all organizations appear exactly once, while a few large labs submit many model sizes to many boards.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522line%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%25220%2525%2522%252C%252210%2525%2522%252C%252220%2525%2522%252C%252230%2525%2522%252C%252240%2525%2522%252C%252250%2525%2522%252C%252260%2525%2522%252C%252270%2525%2522%252C%252280%2525%2522%252C%252290%2525%2522%252C%2522100%2525%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Lorenz%2520curve%2520%2528entries%2520by%2520org%2529%2522%252C%2522data%2522%253A%255B0.1%252C1.1%252C2.2%252C3.4%252C5.0%252C7.1%252C10.2%252C15.2%252C24.1%252C38.6%252C100.0%255D%252C%2522borderColor%2522%253A%2522%25233b5bdb%2522%252C%2522fill%2522%253Afalse%257D%252C%257B%2522label%2522%253A%2522Perfect%2520equality%2522%252C%2522data%2522%253A%255B0%252C10%252C20%252C30%252C40%252C50%252C60%252C70%252C80%252C90%252C100%255D%252C%2522borderColor%2522%253A%2522%2523adb5bd%2522%252C%2522borderDash%2522%253A%255B5%252C5%255D%252C%2522fill%2522%253Afalse%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Cumulative%2520share%2520of%2520entries%2520vs%2520share%2520of%2520orgs%2520%2528Gini%25200.709%2529%2522%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522line%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%25220%2525%2522%252C%252210%2525%2522%252C%252220%2525%2522%252C%252230%2525%2522%252C%252240%2525%2522%252C%252250%2525%2522%252C%252260%2525%2522%252C%252270%2525%2522%252C%252280%2525%2522%252C%252290%2525%2522%252C%2522100%2525%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Lorenz%2520curve%2520%2528entries%2520by%2520org%2529%2522%252C%2522data%2522%253A%255B0.1%252C1.1%252C2.2%252C3.4%252C5.0%252C7.1%252C10.2%252C15.2%252C24.1%252C38.6%252C100.0%255D%252C%2522borderColor%2522%253A%2522%25233b5bdb%2522%252C%2522fill%2522%253Afalse%257D%252C%257B%2522label%2522%253A%2522Perfect%2520equality%2522%252C%2522data%2522%253A%255B0%252C10%252C20%252C30%252C40%252C50%252C60%252C70%252C80%252C90%252C100%255D%252C%2522borderColor%2522%253A%2522%2523adb5bd%2522%252C%2522borderDash%2522%253A%255B5%252C5%255D%252C%2522fill%2522%253Afalse%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Cumulative%2520share%2520of%2520entries%2520vs%2520share%2520of%2520orgs%2520%2528Gini%25200.709%2529%2522%257D%257D%257D" alt="Lorenz curve of leaderboard entries by organization" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Reporting both indicators keeps "no monopoly" from being read as "equal participation". They are answers to different questions.&lt;/p&gt;

&lt;h3&gt;
  
  
  Who actually wins?
&lt;/h3&gt;

&lt;p&gt;We find the #1 entry of each board by sorting on &lt;code&gt;value&lt;/code&gt;: descending by default, ascending when &lt;code&gt;lower_is_better&lt;/code&gt; is true. Across 44 boards, &lt;strong&gt;24 distinct organizations&lt;/strong&gt; hold at least one #1 position. The most frequent holders in this snapshot were FINAL-Bench (9 boards), zai-org (4), deepseek-ai (3) and moonshotai (3), then XiaomiMiMo, ornith-ai, tsinghua-sigs-robot-lab and tencent with 2 each. Leadership is spread across roughly two dozen teams, and the biggest submitters are mostly not the most frequent winners: Qwen has the most entries overall but holds the top spot on only one board in this reading.&lt;/p&gt;

&lt;h2&gt;
  
  
  How close are the top two models on a typical benchmark?
&lt;/h2&gt;

&lt;p&gt;Concentration tells you who shows up. Competitiveness tells you whether the order at the top means anything. For each board with at least two entries we compute the &lt;strong&gt;relative gap&lt;/strong&gt; between #1 and #2:&lt;/p&gt;

&lt;p&gt;$$g = \frac{|v_1 - v_2|}{|v_1|} \times 100\%$$&lt;/p&gt;

&lt;p&gt;A relative measure lets us compare boards scored in percent, in error rate or in arbitrary units. Measured over 43 comparable boards, the median gap is &lt;strong&gt;3.69%&lt;/strong&gt;, and the distribution is wide:&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522%253C1%2525%2522%252C%25221-2%2525%2522%252C%25222-5%2525%2522%252C%25225-10%2525%2522%252C%252210-20%2525%2522%252C%252220-50%2525%2522%252C%2522%253E50%2525%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Boards%2522%252C%2522data%2522%253A%255B9%252C5%252C10%252C9%252C6%252C3%252C1%255D%252C%2522backgroundColor%2522%253A%2522%25235c7cfa%2522%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Relative%2520gap%2520between%2520%25231%2520and%2520%25232%2520%252843%2520boards%252C%2520median%25203.69%2525%2529%2522%257D%252C%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522%253C1%2525%2522%252C%25221-2%2525%2522%252C%25222-5%2525%2522%252C%25225-10%2525%2522%252C%252210-20%2525%2522%252C%252220-50%2525%2522%252C%2522%253E50%2525%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Boards%2522%252C%2522data%2522%253A%255B9%252C5%252C10%252C9%252C6%252C3%252C1%255D%252C%2522backgroundColor%2522%253A%2522%25235c7cfa%2522%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Relative%2520gap%2520between%2520%25231%2520and%2520%25232%2520%252843%2520boards%252C%2520median%25203.69%2525%2529%2522%257D%252C%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%257D%257D" alt="Histogram of relative gap between #1 and #2" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Why does a gap under 1% matter? Most of these benchmarks have a few hundred to a few thousand items. For a binomial accuracy $p$ on $n$ items the standard error is $\sqrt{p(1-p)/n}$. At $p = 0.8$ and $n = 1{,}000$ that is about 1.3 percentage points, or roughly 1.6% in relative terms. Self-reported runs also differ in sampling temperature, prompt template and harness. With all that, a lead under 1% usually cannot be told apart from a tie, so on about one board in five the current #1 could change on a rerun. At the other end, a handful of boards show leads above 20%; that usually means a genuinely new capability, a board with very few entries, or entries scored under different conditions. A large gap is a reason to open the source link, not a conclusion by itself. Our rule for any ranking: report the gap with an uncertainty estimate (2 SE or a bootstrap interval) and call it a tie when the interval contains zero.&lt;/p&gt;

&lt;h2&gt;
  
  
  What share of Hugging Face leaderboard entries are hidden by default?
&lt;/h2&gt;

&lt;p&gt;The default &lt;code&gt;/leaderboard&lt;/code&gt; response, and the default web view, leaves out entries from models whose card declares a &lt;code&gt;base_model&lt;/code&gt;. That removes fine-tunes, merges, quantized variants and other derivative releases. Passing &lt;code&gt;base_model=false&lt;/code&gt; brings them back.&lt;/p&gt;

&lt;p&gt;$$\text{hidden share} = 1 - \frac{\sum_b |L_b^{default}|}{\sum_b |L_b^{full}|}$$&lt;/p&gt;

&lt;p&gt;Measured: &lt;strong&gt;455 of 1,479 entries (30.8%)&lt;/strong&gt; are hidden in the default view, and &lt;strong&gt;34 of 44&lt;/strong&gt; boards hide at least one entry.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Visible%2520by%2520default%2522%252C%2522Hidden%2520%2528base_model%2520filter%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Entries%2522%252C%2522data%2522%253A%255B1024%252C455%255D%252C%2522backgroundColor%2522%253A%255B%2522%25233b5bdb%2522%252C%2522%2523e8590c%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%25221%252C479%2520entries%253A%2520455%2520%252830.8%2525%2529%2520hidden%2520in%2520default%2520view%252C%252034%2520of%252044%2520boards%2522%257D%252C%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Visible%2520by%2520default%2522%252C%2522Hidden%2520%2528base_model%2520filter%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522Entries%2522%252C%2522data%2522%253A%255B1024%252C455%255D%252C%2522backgroundColor%2522%253A%255B%2522%25233b5bdb%2522%252C%2522%2523e8590c%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%25221%252C479%2520entries%253A%2520455%2520%252830.8%2525%2529%2520hidden%2520in%2520default%2520view%252C%252034%2520of%252044%2520boards%2522%257D%252C%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%257D%257D" alt="Visible vs hidden leaderboard entries" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;The filter is a design choice, not a bug: it keeps the default view focused on original models. It still has measurable consequences. A fine-tuned model can outscore its base and stay invisible to anyone who does not change the query. Rankings quoted from the default page and rankings computed with the full population can disagree. Concentration statistics computed only on the default view understate the long tail, because small teams publish a large share of the derivative work. If you report a position on one of these boards, say which view it comes from.&lt;/p&gt;

&lt;h2&gt;
  
  
  How can I reproduce this measurement?
&lt;/h2&gt;

&lt;p&gt;The script below needs only the standard library plus &lt;code&gt;requests&lt;/code&gt;, and runs in under a minute.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;collections&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;statistics&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;st&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;concurrent.futures&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;cf&lt;/span&gt;

&lt;span class="n"&gt;H&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://huggingface.co/api&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="n"&gt;ids&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;d&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;id&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;d&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;H&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;params&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;filter&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;benchmark:official&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;limit&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;200&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt; &lt;span class="n"&gt;timeout&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;60&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()]&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;fetch&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;p&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="k"&gt;try&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="n"&gt;r&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;H&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets/&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/leaderboard&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;params&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;p&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;timeout&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;60&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
            &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;r&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nf"&gt;isinstance&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;r&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;list&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;else&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
        &lt;span class="k"&gt;except&lt;/span&gt; &lt;span class="nb"&gt;Exception&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;({}),&lt;/span&gt; &lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;({&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;base_model&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;false&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;})&lt;/span&gt;

&lt;span class="n"&gt;rows&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;list&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;cf&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;ThreadPoolExecutor&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;8&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;map&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;fetch&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;ids&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;org&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;e&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;e&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;split&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;gini&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="n"&gt;x&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;sorted&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt; &lt;span class="n"&gt;n&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt; &lt;span class="n"&gt;s&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;((&lt;/span&gt;&lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="o"&gt;*&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="n"&gt;n&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="n"&gt;v&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;v&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nf"&gt;enumerate&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt; &lt;span class="o"&gt;/&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;n&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;entries&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;firsts&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;collections&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;Counter&lt;/span&gt;&lt;span class="p"&gt;(),&lt;/span&gt; &lt;span class="n"&gt;collections&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;Counter&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="n"&gt;gaps&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;n_default&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;n_full&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[],&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;
&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;bid&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;default&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;full&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;full&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;full&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;=&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;default&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;else&lt;/span&gt; &lt;span class="n"&gt;default&lt;/span&gt;
    &lt;span class="n"&gt;n_default&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;default&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt; &lt;span class="n"&gt;n_full&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;e&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="n"&gt;entries&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="nf"&gt;org&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;e&lt;/span&gt;&lt;span class="p"&gt;)]&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;continue&lt;/span&gt;
    &lt;span class="n"&gt;lib&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;lower_is_better&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="bp"&gt;False&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;s&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;sorted&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;full&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="k"&gt;lambda&lt;/span&gt; &lt;span class="n"&gt;e&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;e&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt; &lt;span class="n"&gt;reverse&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;lib&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="nf"&gt;org&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;])]&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt; &lt;span class="ow"&gt;and&lt;/span&gt; &lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]:&lt;/span&gt;
        &lt;span class="n"&gt;gaps&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;append&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nf"&gt;abs&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;])&lt;/span&gt; &lt;span class="o"&gt;/&lt;/span&gt; &lt;span class="nf"&gt;abs&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;s&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;])&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;100&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;v&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;sorted&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;entries&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;values&lt;/span&gt;&lt;span class="p"&gt;(),&lt;/span&gt; &lt;span class="n"&gt;reverse&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt; &lt;span class="n"&gt;N&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;v&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;orgs&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;entries&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;entries&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;N&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gini&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;round&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nf"&gt;gini&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;v&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;top5&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;round&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;100&lt;/span&gt;&lt;span class="o"&gt;*&lt;/span&gt;&lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;v&lt;/span&gt;&lt;span class="p"&gt;[:&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;])&lt;/span&gt;&lt;span class="o"&gt;/&lt;/span&gt;&lt;span class="n"&gt;N&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;top10&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;round&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;100&lt;/span&gt;&lt;span class="o"&gt;*&lt;/span&gt;&lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;v&lt;/span&gt;&lt;span class="p"&gt;[:&lt;/span&gt;&lt;span class="mi"&gt;10&lt;/span&gt;&lt;span class="p"&gt;])&lt;/span&gt;&lt;span class="o"&gt;/&lt;/span&gt;&lt;span class="n"&gt;N&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;median gap %&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;round&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;st&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;median&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;gaps&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gap&amp;lt;1%&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;sum&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;g&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;g&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;gaps&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;hidden %&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;round&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;100&lt;/span&gt;&lt;span class="o"&gt;*&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="n"&gt;n_default&lt;/span&gt;&lt;span class="o"&gt;/&lt;/span&gt;&lt;span class="n"&gt;n_full&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;top #1 holders&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;most_common&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;8&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Run it on another day and the numbers will differ. That is expected: the method stays fixed, and each run records the state of the boards on its own date.&lt;/p&gt;

&lt;h2&gt;
  
  
  What are the limits of this measurement?
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;An organization here is a namespace, not a legal entity.&lt;/strong&gt; One company may publish under several namespaces, and one namespace may host several teams. We did not merge or split any.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Scores are mostly self-reported.&lt;/strong&gt; Most rows carry &lt;code&gt;verified: false&lt;/code&gt; and cite a model card. We measure the published board, not the truth behind each number.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ties and sort direction.&lt;/strong&gt; We trust the &lt;code&gt;lower_is_better&lt;/code&gt; flag and treat multi-metric datasets exactly as the API returns them.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Snapshot effect.&lt;/strong&gt; Entries arrive as pull requests to model repositories, so one large release can move the top-k share by several points in a day.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;The gap metric ignores noise.&lt;/strong&gt; A relative gap has no units and no per-board significance test; the binomial SE above is a rough guide.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Disclosure
&lt;/h2&gt;

&lt;p&gt;QuantID is a technology alliance partner of VIDRAFT, which appears on several boards (including under the FINAL-Bench namespace); data shown here is computed identically for every organization.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;How many official benchmark leaderboards are on Hugging Face?&lt;/strong&gt;&lt;br&gt;
On 2026-10-06 the API returned 48 datasets tagged &lt;code&gt;benchmark:official&lt;/code&gt;. Of those, 44 had at least one leaderboard entry.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Is AI benchmark leadership dominated by a few labs?&lt;/strong&gt;&lt;br&gt;
Participation is unequal: the full-population Gini is 0.709 and the top 10 organizations hold 59.0% of visible entries. Still, #1 positions are spread across 24 organizations, and no organization holds more than about 13% of all entries.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Why don't I see some models on a Hugging Face leaderboard?&lt;/strong&gt;&lt;br&gt;
The default view hides entries from models that declare a &lt;code&gt;base_model&lt;/code&gt; in their card. Add &lt;code&gt;?base_model=false&lt;/code&gt; to the API call to see them. In this snapshot that filter hid 30.8% of all entries across 34 of 44 boards.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;How close are the top two models on a typical board?&lt;/strong&gt;&lt;br&gt;
The median relative gap between #1 and #2 was 3.69%. On 9 of 43 boards it was under 1%, which is usually within run-to-run noise.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Why report both Gini and HHI?&lt;/strong&gt;&lt;br&gt;
HHI is driven by the biggest shares, so it stays low when no single organization is large. Gini measures inequality across the whole distribution, including the long tail of single-entry participants. Reporting both prevents "no monopoly" from being read as "equal participation".&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Can I get these numbers live?&lt;/strong&gt;&lt;br&gt;
Yes. The script above reproduces them, and we maintain a live map of all official boards as a public Space.&lt;/p&gt;

&lt;h2&gt;
  
  
  Further reading
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Live map of all official benchmark leaderboards: &lt;a href="https://huggingface.co/spaces/quantid/huggingface-official-benchmark-leaderboards" rel="noopener noreferrer"&gt;huggingface.co/spaces/quantid/huggingface-official-benchmark-leaderboards&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;QuantID on Hugging Face: &lt;a href="https://huggingface.co/quantid" rel="noopener noreferrer"&gt;huggingface.co/quantid&lt;/a&gt;
&lt;/li&gt;
&lt;/ul&gt;

</description>
      <category>datascience</category>
      <category>huggingface</category>
      <category>benchmark</category>
      <category>statistics</category>
    </item>
  </channel>
</rss>
