<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Zero_planck</title>
    <description>The latest articles on DEV Community by Zero_planck (@zeroextubcollab).</description>
    <link>https://dev.to/zeroextubcollab</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4051410%2F04d85f37-4d6a-4c51-b237-413864031e9e.jpg</url>
      <title>DEV Community: Zero_planck</title>
      <link>https://dev.to/zeroextubcollab</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/zeroextubcollab"/>
    <language>en</language>
    <item>
      <title>Please support guys !!!!!!!!</title>
      <dc:creator>Zero_planck</dc:creator>
      <pubDate>Tue, 28 Jul 2026 16:40:03 +0000</pubDate>
      <link>https://dev.to/zeroextubcollab/please-support-guys--3nee</link>
      <guid>https://dev.to/zeroextubcollab/please-support-guys--3nee</guid>
      <description>&lt;div class="ltag__link--embedded"&gt;
  &lt;div class="crayons-story "&gt;
  &lt;a href="https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g" class="crayons-story__hidden-navigation-link"&gt;I Built a CUDA Engine That Streams 744B Parameter AI Models on Consumer Hardware&lt;/a&gt;


  &lt;div class="crayons-story__body crayons-story__body-full_post"&gt;
    &lt;div class="crayons-story__top"&gt;
      &lt;div class="crayons-story__meta"&gt;
        &lt;div class="crayons-story__author-pic"&gt;

          &lt;a href="/zeroextubcollab" class="crayons-avatar  crayons-avatar--l  "&gt;
            &lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4051410%2F04d85f37-4d6a-4c51-b237-413864031e9e.jpg" alt="zeroextubcollab profile" class="crayons-avatar__image" width="800" height="450"&gt;
          &lt;/a&gt;
        &lt;/div&gt;
        &lt;div&gt;
          &lt;div&gt;
            &lt;a href="/zeroextubcollab" class="crayons-story__secondary fw-medium m:hidden"&gt;
              Zero_planck
            &lt;/a&gt;
            &lt;div class="profile-preview-card relative mb-4 s:mb-0 fw-medium hidden m:inline-block"&gt;
              
                Zero_planck
                
              
              &lt;div id="story-author-preview-content-4255896" class="profile-preview-card__content crayons-dropdown branded-7 p-4 pt-0"&gt;
                &lt;div class="gap-4 grid"&gt;
                  &lt;div class="-mt-4"&gt;
                    &lt;a href="/zeroextubcollab" class="flex"&gt;
                      &lt;span class="crayons-avatar crayons-avatar--xl mr-2 shrink-0"&gt;
                        &lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4051410%2F04d85f37-4d6a-4c51-b237-413864031e9e.jpg" class="crayons-avatar__image" alt="" width="800" height="450"&gt;
                      &lt;/span&gt;
                      &lt;span class="crayons-link crayons-subtitle-2 mt-5"&gt;Zero_planck&lt;/span&gt;
                    &lt;/a&gt;
                  &lt;/div&gt;
                  &lt;div class="print-hidden"&gt;
                    
                      Follow
                    
                  &lt;/div&gt;
                  &lt;div class="author-preview-metadata-container"&gt;&lt;/div&gt;
                &lt;/div&gt;
              &lt;/div&gt;
            &lt;/div&gt;

          &lt;/div&gt;
          &lt;a href="https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g" class="crayons-story__tertiary fs-xs"&gt;&lt;time&gt;Jul 28&lt;/time&gt;&lt;span class="time-ago-indicator-initial-placeholder"&gt;&lt;/span&gt;&lt;/a&gt;
        &lt;/div&gt;
      &lt;/div&gt;

    &lt;/div&gt;

    &lt;div class="crayons-story__indention"&gt;
      &lt;h2 class="crayons-story__title crayons-story__title-full_post"&gt;
        &lt;a href="https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g" id="article-link-4255896"&gt;
          I Built a CUDA Engine That Streams 744B Parameter AI Models on Consumer Hardware
        &lt;/a&gt;
      &lt;/h2&gt;
        &lt;div class="crayons-story__tags"&gt;
            &lt;a class="crayons-tag  crayons-tag--monochrome " href="/t/ai"&gt;&lt;span class="crayons-tag__prefix"&gt;#&lt;/span&gt;ai&lt;/a&gt;
            &lt;a class="crayons-tag  crayons-tag--monochrome " href="/t/cuda"&gt;&lt;span class="crayons-tag__prefix"&gt;#&lt;/span&gt;cuda&lt;/a&gt;
            &lt;a class="crayons-tag  crayons-tag--monochrome " href="/t/opensource"&gt;&lt;span class="crayons-tag__prefix"&gt;#&lt;/span&gt;opensource&lt;/a&gt;
            &lt;a class="crayons-tag  crayons-tag--monochrome " href="/t/machinelearning"&gt;&lt;span class="crayons-tag__prefix"&gt;#&lt;/span&gt;machinelearning&lt;/a&gt;
        &lt;/div&gt;
      &lt;div class="crayons-story__bottom"&gt;
        &lt;div class="crayons-story__details"&gt;
          &lt;a href="https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g" class="crayons-btn crayons-btn--s crayons-btn--ghost crayons-btn--icon-left"&gt;
            &lt;div class="multiple_reactions_aggregate"&gt;
              &lt;span class="multiple_reactions_icons_container"&gt;
                  &lt;span class="crayons_icon_container"&gt;
                    &lt;img src="https://assets.dev.to/assets/sparkle-heart-5f9bee3767e18deb1bb725290cb151c25234768a0e9a2bd39370c382d02920cf.svg" width="24" height="24"&gt;
                  &lt;/span&gt;
              &lt;/span&gt;
              &lt;span class="aggregate_reactions_counter"&gt;1&lt;span class="hidden s:inline"&gt;&amp;nbsp;reaction&lt;/span&gt;&lt;/span&gt;
            &lt;/div&gt;
          &lt;/a&gt;
            &lt;a href="https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g#comments" class="crayons-btn crayons-btn--s crayons-btn--ghost crayons-btn--icon-left flex items-center"&gt;
              

              &lt;span class="hidden s:inline"&gt;Add&amp;nbsp;Comment&lt;/span&gt;
            &lt;/a&gt;
        &lt;/div&gt;
        &lt;div class="crayons-story__save"&gt;
          &lt;small class="crayons-story__tertiary fs-xs mr-2"&gt;
            4 min read
          &lt;/small&gt;
            
              &lt;span class="bm-initial crayons-icon c-btn__icon"&gt;
                

              &lt;/span&gt;
              &lt;span class="bm-success crayons-icon c-btn__icon"&gt;
                

              &lt;/span&gt;
            
        &lt;/div&gt;
      &lt;/div&gt;
    &lt;/div&gt;
  &lt;/div&gt;
&lt;/div&gt;

&lt;/div&gt;


</description>
    </item>
    <item>
      <title>I Built a CUDA Engine That Streams 744B Parameter AI Models on Consumer Hardware</title>
      <dc:creator>Zero_planck</dc:creator>
      <pubDate>Tue, 28 Jul 2026 16:39:05 +0000</pubDate>
      <link>https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g</link>
      <guid>https://dev.to/zeroextubcollab/i-built-a-cuda-engine-that-streams-744b-parameter-ai-models-on-consumer-hardware-147g</guid>
      <description>&lt;h1&gt;
  
  
  WISP — Stream What Shouldn't Run
&lt;/h1&gt;

&lt;p&gt;Last week JustVugg dropped Colibrì — a 2,400-line pure C &lt;br&gt;
engine that proved a 744B parameter model could run on 25GB &lt;br&gt;
of consumer RAM by streaming expert weights from disk.&lt;/p&gt;

&lt;p&gt;It blew my mind. So I built on top of that concept.&lt;/p&gt;

&lt;p&gt;This is WISP.&lt;/p&gt;




&lt;h2&gt;
  
  
  The Problem
&lt;/h2&gt;

&lt;p&gt;The largest open source AI models in the world — GLM-5.2 &lt;br&gt;
(744B), DeepSeek-V3 (671B), Kimi K3 (2.8T) — require &lt;br&gt;
datacenter hardware to run. Most people trying to run them &lt;br&gt;
locally hit a wall immediately.&lt;/p&gt;

&lt;p&gt;The standard approaches all make the same tradeoff:&lt;br&gt;
quantize aggressively until the model fits, or don't run it.&lt;/p&gt;

&lt;p&gt;Both options sacrifice intelligence for accessibility.&lt;/p&gt;




&lt;h2&gt;
  
  
  The Insight (Credit: JustVugg / Colibrì)
&lt;/h2&gt;

&lt;p&gt;MoE (Mixture-of-Experts) models don't activate all their &lt;br&gt;
parameters for every token. GLM-5.2 activates ~5.4% per &lt;br&gt;
token. Kimi K3 activates ~1.8%.&lt;/p&gt;

&lt;p&gt;This means you don't need to fit the whole model in RAM.&lt;br&gt;
You just need to stream the right experts fast enough.&lt;/p&gt;

&lt;p&gt;Token arrives&lt;br&gt;
↓&lt;br&gt;
Model's own router selects which experts to activate&lt;br&gt;
↓&lt;br&gt;
Check VRAM first → instant if cached&lt;br&gt;
↓&lt;br&gt;
Then RAM → fast if cached&lt;br&gt;
↓&lt;br&gt;
Then NVMe SSD → stream if cold&lt;br&gt;
↓&lt;br&gt;
LRU cache promotes hot experts upward automatically&lt;/p&gt;

&lt;p&gt;After 10-15 minutes in one domain, the cache self-organizes &lt;br&gt;
to 85-92% hit rate. No configuration. Fully automatic.&lt;/p&gt;




&lt;h2&gt;
  
  
  What WISP Adds on Top
&lt;/h2&gt;

&lt;p&gt;Colibrì proved the concept for one model (GLM-5.2) in pure C.&lt;/p&gt;

&lt;p&gt;WISP extends it to every major MoE model with full CUDA &lt;br&gt;
acceleration:&lt;/p&gt;

&lt;h3&gt;
  
  
  Absorbed MLA Attention
&lt;/h3&gt;

&lt;p&gt;GLM-5.2 and DeepSeek use Multi-head Latent Attention.&lt;br&gt;
WISP implements true absorbed MLA — storing compressed c_kv &lt;br&gt;
instead of expanded K,V tensors.&lt;/p&gt;

&lt;p&gt;Result: &lt;strong&gt;~70KB per token&lt;/strong&gt; KV cache instead of ~5MB.&lt;br&gt;
This is what makes 1M token context feasible in RAM.&lt;/p&gt;

&lt;h3&gt;
  
  
  Double-Buffer Async Pipeline
&lt;/h3&gt;

&lt;p&gt;While the GPU computes token N (2-8ms), the C engine loads &lt;br&gt;
token N+1's predicted experts from SSD into pinned RAM &lt;br&gt;
(0.1-0.3ms). Transfer is fully hidden inside compute time.&lt;br&gt;
GPU never waits. No GPUDirect Storage needed.&lt;/p&gt;

&lt;h3&gt;
  
  
  Same-Family Speculative Decoding
&lt;/h3&gt;

&lt;p&gt;Small models from the same family draft 3 tokens &lt;br&gt;
simultaneously. The main model verifies all 3 in one &lt;br&gt;
parallel forward pass. At 39-55% acceptance rate this gives&lt;br&gt;
2.2-2.8x effective throughput with zero quality loss&lt;br&gt;
(Leviathan et al. 2023).&lt;/p&gt;

&lt;h3&gt;
  
  
  Auto-Config Everything
&lt;/h3&gt;

&lt;p&gt;WISP profiles your hardware once on first run and &lt;br&gt;
calculates the optimal VRAM/RAM/SSD split automatically.&lt;br&gt;
It even detects whether your monitor is on the GPU or &lt;br&gt;
motherboard and reserves VRAM accordingly.&lt;/p&gt;




&lt;h2&gt;
  
  
  The Stack
&lt;/h2&gt;

&lt;p&gt;Python → orchestration (download, convert, configure)&lt;br&gt;
C → hot path (64-1504 expert fetches per token)&lt;br&gt;
CUDA → math (attention, routing, FFN, speculation)&lt;/p&gt;

&lt;p&gt;Three layers. One job each.&lt;/p&gt;




&lt;h2&gt;
  
  
  What's Supported
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Parameters&lt;/th&gt;
&lt;th&gt;Active/token&lt;/th&gt;
&lt;th&gt;Status&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GLM-5.2&lt;/td&gt;
&lt;td&gt;744B&lt;/td&gt;
&lt;td&gt;40B&lt;/td&gt;
&lt;td&gt;✅ Ready&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSeek-V3&lt;/td&gt;
&lt;td&gt;671B&lt;/td&gt;
&lt;td&gt;37B&lt;/td&gt;
&lt;td&gt;✅ Ready&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSeek-R1&lt;/td&gt;
&lt;td&gt;671B&lt;/td&gt;
&lt;td&gt;37B&lt;/td&gt;
&lt;td&gt;✅ Ready&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mixtral-8x7B&lt;/td&gt;
&lt;td&gt;47B&lt;/td&gt;
&lt;td&gt;13B&lt;/td&gt;
&lt;td&gt;✅ Verified&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mixtral-8x22B&lt;/td&gt;
&lt;td&gt;141B&lt;/td&gt;
&lt;td&gt;39B&lt;/td&gt;
&lt;td&gt;✅ Ready&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kimi K3&lt;/td&gt;
&lt;td&gt;2.8T&lt;/td&gt;
&lt;td&gt;~50B&lt;/td&gt;
&lt;td&gt;⏳ July 27&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Qwen3.8&lt;/td&gt;
&lt;td&gt;2.4T&lt;/td&gt;
&lt;td&gt;TBD&lt;/td&gt;
&lt;td&gt;⏳ Soon&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;




&lt;h2&gt;
  
  
  Real Benchmark — Mixtral-8x7B on RTX 5070
&lt;/h2&gt;

&lt;p&gt;Verified on: R7 9800X3D | RTX 5070 12GB | &lt;br&gt;
32GB DDR5-6000 | PCIe 4.0 NVMe (4.34 GB/s)&lt;/p&gt;

&lt;p&gt;Cold tok/s: 0.75 tok/s (measured)&lt;br&gt;
Cache hit rate: 68.8% after only 80 tokens&lt;br&gt;
Expert fetches: 64 per token (2 experts × 32 layers)&lt;br&gt;
All 256 experts: Fit entirely in RAM (14.3GB)&lt;br&gt;
After warm-up: Zero SSD reads&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Why is Mixtral slower than GLM-5.2 will be?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Mixtral experts = 99MB each.&lt;br&gt;
GLM-5.2 experts = 17.5MB each.&lt;/p&gt;

&lt;p&gt;5.7x smaller experts = 5.7x less data per token.&lt;br&gt;
GLM-5.2 is where WISP's architecture truly sings.&lt;/p&gt;




&lt;h2&gt;
  
  
  Lessons From Building This
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Lesson 1: The bottleneck is always the SSD&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Every optimization that doesn't improve cache hit rate &lt;br&gt;
or reduce bytes-per-token is noise. CUDA for expert matmul &lt;br&gt;
gives near-zero benefit on a 9800X3D because the CPU is &lt;br&gt;
already fast enough — the NVMe is the wall.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Lesson 2: The model's router is the best scheduler&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;We don't predict or preload experts manually. The model's &lt;br&gt;
own router fires on every token and tells us exactly what &lt;br&gt;
it needs. Our LRU cache learns from this automatically.&lt;br&gt;
No heuristics. No preset domain modes. Pure adaptation.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Lesson 3: Windows GPU display is a real problem&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Running inference on the same GPU that drives your monitor &lt;br&gt;
will black screen your display. The GPU tries to do both &lt;br&gt;
and the display loses. We ship display auto-detection that &lt;br&gt;
reserves VRAM and prevents this automatically.&lt;br&gt;
Learned this the hard way.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Lesson 4: Honest numbers matter more than impressive ones&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;The README says "We do not publish a bold number we didn't &lt;br&gt;
measure." Every estimate is labeled as an estimate. Every &lt;br&gt;
measured number has the exact conditions listed.&lt;br&gt;
People trust projects that are honest about limitations.&lt;/p&gt;




&lt;h2&gt;
  
  
  Credits
&lt;/h2&gt;

&lt;p&gt;WISP wouldn't exist without &lt;strong&gt;Colibrì&lt;/strong&gt; by JustVugg.&lt;br&gt;
He built the proof of concept. We built the generalization.&lt;/p&gt;

&lt;p&gt;Full credit: github.com/JustVugg/colibri&lt;/p&gt;




&lt;h2&gt;
  
  
  Get Started
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;pip &lt;span class="nb"&gt;install &lt;/span&gt;wisp-engine
wisp convert &lt;span class="nt"&gt;--model&lt;/span&gt; glm-5.2 &lt;span class="nt"&gt;--output&lt;/span&gt; ./models/
wisp chat &lt;span class="nt"&gt;--model&lt;/span&gt; ./models/glm-5.2/
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;&lt;strong&gt;Requirements:&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;16GB+ RAM&lt;/li&gt;
&lt;li&gt;Any NVMe SSD with 300GB+ free&lt;/li&gt;
&lt;li&gt;CUDA GPU with 8GB+ VRAM (optional, CPU-only works)&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  What's Next
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;July 27 — Kimi K3 day&lt;/strong&gt;&lt;br&gt;
Weights drop. Technical report publishes. We implement &lt;br&gt;
KDA attention and Quantile Balancing router. WISP streams &lt;br&gt;
2.8 trillion parameters on consumer hardware.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;v1.1&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Learning cache (gets faster with use)&lt;/li&gt;
&lt;li&gt;Persistent KV cache (resume conversations)&lt;/li&gt;
&lt;li&gt;Web dashboard with expert heatmap&lt;/li&gt;
&lt;li&gt;ROCm support (AMD R9700)&lt;/li&gt;
&lt;li&gt;OpenAI-compatible API server&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;strong&gt;73 tests passing. MIT license.&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;github.com/zeroextub-collab/wisp&lt;/p&gt;

&lt;p&gt;&lt;em&gt;Built on the shoulders of Colibrì. &lt;br&gt;
JustVugg showed us what was possible.&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>cuda</category>
      <category>opensource</category>
      <category>machinelearning</category>
    </item>
  </channel>
</rss>
