<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Esseba-dev</title>
    <description>The latest articles on DEV Community by Esseba-dev (@essebauserdev).</description>
    <link>https://dev.to/essebauserdev</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4076799%2Fa23c5fe9-a409-4282-a5f1-537e7aca8741.jpg</url>
      <title>DEV Community: Esseba-dev</title>
      <link>https://dev.to/essebauserdev</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/essebauserdev"/>
    <language>en</language>
    <item>
      <title>Native vLLM + ROCm 7.15 Runtime for RX 6000 (RDNA2) on Windows 11 — 26 TFLOPS FP16, 62 tok/s, One-Click Install, No WSL2 [RX 6750 XT gfx1031 Verified]</title>
      <dc:creator>Esseba-dev</dc:creator>
      <pubDate>Tue, 18 Aug 2026 10:02:38 +0000</pubDate>
      <link>https://dev.to/essebauserdev/native-vllm-rocm-715-runtime-for-rx-6000-rdna2-on-windows-11-26-tflops-fp16-62-toks-3aa6</link>
      <guid>https://dev.to/essebauserdev/native-vllm-rocm-715-runtime-for-rx-6000-rdna2-on-windows-11-26-tflops-fp16-62-toks-3aa6</guid>
      <description>&lt;p&gt;I built a native vLLM + ROCm 7.15 runtime for AMD RX 6000 Series on Windows 11 — now with a one-click installer.&lt;/p&gt;

&lt;p&gt;AMD lists RX 6750 XT / 6700 XT / 6600 XT as "Runtime only" on Windows with HIP SDK excluded. I built rocBLAS binaries for gfx1031 via ROCm/TheRock to close that gap.&lt;/p&gt;

&lt;p&gt;This runs native Windows HIP and ROCm directly, no WSL2 wrapper, no compiler needed.&lt;/p&gt;

&lt;p&gt;Tested on AMD Radeon RX 6750 XT 12GB (gfx1031) — Windows 11 Native — August 2026&lt;/p&gt;

&lt;h1&gt;
  
  
  Verification — Real terminal logs
&lt;/h1&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Environment:&lt;/p&gt;

&lt;p&gt;torch 2.12.0+rocm7.15.0 | cuda_avail True | dev AMD Radeon RX 6750 XT&lt;br&gt;
vLLM 0.19.1 | plugin vllm_windows_rocm activated | TRITON_ATTN | enforce_eager=True&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;rocBLAS Benchmark — 26 TFLOPS FP16:&lt;/p&gt;

&lt;p&gt;Device ID 0 : AMD Radeon RX 6750 XT gfx1031 with 12.9 GB memory&lt;br&gt;
rocBLAS version: 5.7.0.67811f1ee52&lt;br&gt;
transA,transB,M,N,K,alpha,lda,beta,ldb,ldc,cold_iters,hot_iters,rocblas-Gflops,us&lt;br&gt;
N,N,4096,4096,4096,1,4096,0,4096,4096, 2, 10, 25977.3, 5290.73&lt;br&gt;
=&amp;gt; 25.97 TFLOPS in 5.29ms&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;vLLM Inference (Qwen3.5-4B, web chat UI):&lt;/p&gt;

&lt;p&gt;Output: 59-62 tok/s | Init ~1s | hidden thinking (spinner) then answer&lt;br&gt;
Model auto-detected via /v1/models&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Full logs in benchmarks/ and screenshots in assets/ on GitHub.&lt;/p&gt;

&lt;h1&gt;
  
  
  How it works
&lt;/h1&gt;

&lt;ol&gt;
&lt;li&gt; TheRock builds clr (HIP) and rocBLAS with Tensile kernels for gfx1031&lt;/li&gt;
&lt;li&gt; HSA_OVERRIDE_GFX_VERSION=10.3.0 forces HIP to recognize RX 6750 XT&lt;/li&gt;
&lt;li&gt; PyTorch 2.12.0+rocm7.15 links against TheRock runtime =&amp;gt; torch.cuda.is_available() True&lt;/li&gt;
&lt;li&gt; vLLM plugin vllm_windows_rocm bypasses vllm._C dependency and registers WinRocmAwqGemvKernel with TRITON_ATTN&lt;/li&gt;
&lt;li&gt; vLLM engine loads with enforce_eager=True and runs native&lt;/li&gt;
&lt;/ol&gt;

&lt;h1&gt;
  
  
  Quick Start — One click
&lt;/h1&gt;

&lt;p&gt;Prerequisites: Windows 11 23H2+, RX 6600-6750 XT (gfx1030/gfx1031/gfx1032), Adrenalin 24.x+, ~8GB free disk&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt; Download the repo (or git clone) and run INSTALL.bat as Administrator&lt;/li&gt;
&lt;li&gt; The installer downloads the release archives automatically (multi-part join included, no manual steps) and sets up C:\TheRock\ + Python 3.11 + venv&lt;/li&gt;
&lt;li&gt; Run CHAT.bat — the browser opens the chat UI. Expected: 59-62 tok/s&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;VERIFY.bat runs a 3-in-1 check: GPU detection + rocBLAS benchmark + vLLM smoke test.&lt;/p&gt;

&lt;h1&gt;
  
  
  What's new in v2.0
&lt;/h1&gt;

&lt;ul&gt;
&lt;li&gt;  One-click installer: INSTALL.bat auto-downloads and joins split archives (no browser upload/download hassle)&lt;/li&gt;
&lt;li&gt;  Chat web UI (OpenAI-compatible API): hidden thinking with spinner, then the answer streams — like NVIDIA ChatRTX&lt;/li&gt;
&lt;li&gt;  Fat-binary gemv kernels for all RDNA2 (gfx1030/1031/1032) — no per-card rebuild&lt;/li&gt;
&lt;li&gt;  ROCm 7.15 native, vLLM 0.19.1, torch 2.12.0+rocm7.15&lt;/li&gt;
&lt;li&gt;  Faster: 59-62 tok/s output (was 54.2)&lt;/li&gt;
&lt;li&gt;  Repo cleaned: INSTALL.bat + CHAT.bat + VERIFY.bat + MANIFEST.json + docs, archives on GitHub Releases&lt;/li&gt;
&lt;/ul&gt;

&lt;h1&gt;
  
  
  Known Issues — Please note this may have bugs
&lt;/h1&gt;

&lt;p&gt;This is an experimental reference implementation. It works on my RX 6750 XT but could present bugs on other hardware.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;  Other RDNA2 cards (6600/6600 XT/6700 XT) not yet tested — may need 10.3.0 vs 10.3.1 or rocBLAS rebuild for gfx1030&lt;/li&gt;
&lt;li&gt;  enforce_eager=True required — torch.compile disabled on RDNA2 Windows&lt;/li&gt;
&lt;li&gt;  FP8 / AWQ not tested yet, multi-GPU not tested&lt;/li&gt;
&lt;li&gt;  If you test it on your RDNA2 card, please open an Issue with GPU model and logs — contributions welcome&lt;/li&gt;
&lt;/ul&gt;

&lt;h1&gt;
  
  
  GitHub Repo:
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://github.com/sebastianmechno-sys/vllm-rocm-windows-rdna2" rel="noopener noreferrer"&gt;https://github.com/sebastianmechno-sys/vllm-rocm-windows-rdna2&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Includes INSTALL.bat, CHAT.bat, VERIFY.bat, scripts/serve.py (OpenAI-compatible API), chat.html, assets with screenshots, docs/BUILD_ROCBLAS.md, MANIFEST.json with release checksums&lt;/p&gt;

&lt;p&gt;Let me know if you test it on other RDNA2 cards.&lt;/p&gt;

&lt;p&gt;Built on ROCm/TheRock, PyTorch ROCm, vLLM. Not affiliated with AMD. License Apache 2.0&lt;/p&gt;

</description>
      <category>hardware</category>
      <category>llm</category>
      <category>machinelearning</category>
      <category>performance</category>
    </item>
    <item>
      <title>I Got vLLM Running Natively on Windows on RX 6750 XT (RDNA2) – ROCm 7.15 PoC at 25.9 TFLOPS, No WSL2</title>
      <dc:creator>Esseba-dev</dc:creator>
      <pubDate>Thu, 13 Aug 2026 21:13:10 +0000</pubDate>
      <link>https://dev.to/essebauserdev/i-got-vllm-running-natively-on-windows-on-rx-6750-xt-rdna2-rocm-715-poc-at-259-tflops-no-wsl2-42i2</link>
      <guid>https://dev.to/essebauserdev/i-got-vllm-running-natively-on-windows-on-rx-6750-xt-rdna2-rocm-715-poc-at-259-tflops-no-wsl2-42i2</guid>
      <description>&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fph4xzhjn3gwur593hdyk.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fph4xzhjn3gwur593hdyk.png" alt=" " width="800" height="450"&gt;&lt;/a&gt;&lt;br&gt;
&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fmkjgs5khtvhgxawhs9mn.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fmkjgs5khtvhgxawhs9mn.png" alt=" " width="800" height="450"&gt;&lt;/a&gt;I'm 17, mechanic from Torino. I built vLLM to run NATIVELY on Windows on my RX 6750 XT 12GB (gfx1031 / RDNA2).&lt;/p&gt;

&lt;p&gt;AMD lists RDNA2 as "runtime-only" on ROCm 7.15 Windows. I got around it.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Repo PoC:&lt;/strong&gt; &lt;a href="https://github.com/sebastianmechno-sys/vllm-rocm-windows-rdna2" rel="noopener noreferrer"&gt;https://github.com/sebastianmechno-sys/vllm-rocm-windows-rdna2&lt;/a&gt;&lt;br&gt;
&lt;strong&gt;Upstream issue:&lt;/strong&gt; &lt;a href="https://github.com/ROCm/TheRock/issues/7341" rel="noopener noreferrer"&gt;https://github.com/ROCm/TheRock/issues/7341&lt;/a&gt;&lt;/p&gt;

&lt;h3&gt;
  
  
  The Problem
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;RX 6750 XT = gfx1031, not officially supported for full ROCm 7.15 Windows&lt;/li&gt;
&lt;li&gt;vLLM depends on Triton attention kernels tuned for CDNA, they crash on RDNA2&lt;/li&gt;
&lt;li&gt;FP8 not supported on RDNA2 (only FP16/INT8/INT4)&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  How I Fixed It
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;Built &lt;code&gt;rocBLAS&lt;/code&gt; for &lt;code&gt;gfx1031&lt;/code&gt; via TheRock with &lt;code&gt;HSA_OVERRIDE_GFX_VERSION=10.3.1&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Custom &lt;code&gt;ROCM_PATH&lt;/code&gt; + TheRock artifacts&lt;/li&gt;
&lt;li&gt;vLLM 0.19 with custom plugin:&lt;/li&gt;
&lt;/ol&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;
bash
VLLM_USE_TRITON_ATTN=0
VLLM_ROCM_USE_AITER=0
enforce_eager=True
torch.compile = off

Benchmarks (native Windows, no WSL2)
GEMM 4096x4096 FP16: 25.97 TFLOPS
opt-125m prompt: 107.9 tok/s, output: 54.2 tok/s (batch 8-32)
12GB VRAM: 10.3GB alloc, 5.47GB KV cache
FP16 stable, FP8 fails as expected on RDNA2
![ ](https://dev-to-uploads.s3.us-east-2.amazonaws.com/uploads/articles/hd9fxjwyruywcos112xw.png)
![ ](https://dev-to-uploads.s3.us-east-2.amazonaws.com/uploads/articles/a4p1357aiqgf9cm0w61w.png)
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;

</description>
      <category>amd</category>
      <category>rocm</category>
      <category>llm</category>
      <category>machinelearning</category>
    </item>
  </channel>
</rss>
