<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: ryan2run</title>
    <description>The latest articles on DEV Community by ryan2run (@ryan_zhao).</description>
    <link>https://dev.to/ryan_zhao</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4118260%2Fbf4cdc0a-e5d6-458f-9fa9-89818f1b7c57.jpg</url>
      <title>DEV Community: ryan2run</title>
      <link>https://dev.to/ryan_zhao</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/ryan_zhao"/>
    <language>en</language>
    <item>
      <title>GLM-5.3: The Post-Training Revolution That's Reshaping AI Development</title>
      <dc:creator>ryan2run</dc:creator>
      <pubDate>Wed, 09 Sep 2026 23:15:52 +0000</pubDate>
      <link>https://dev.to/ryan_zhao/glm-53-the-post-training-revolution-thats-reshaping-ai-development-5d84</link>
      <guid>https://dev.to/ryan_zhao/glm-53-the-post-training-revolution-thats-reshaping-ai-development-5d84</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.3: The Post-Training Revolution That's Reshaping AI Development
&lt;/h1&gt;

&lt;h2&gt;
  
  
  How Z.ai Proved That Training Methods Matter More Than Model Size
&lt;/h2&gt;

&lt;p&gt;&lt;em&gt;Published: September 9, 2026 | Reading time: 8 minutes&lt;/em&gt;&lt;/p&gt;




&lt;h2&gt;
  
  
  The Counterintuitive Breakthrough
&lt;/h2&gt;

&lt;p&gt;In August 2026, Z.ai released GLM-5.3, a model that defied the conventional wisdom of AI development. With 743 billion parameters—identical to its predecessor GLM-5.2—the model achieved a 50% improvement in programming capabilities and topped global cybersecurity benchmarks, all without changing the base architecture.&lt;/p&gt;

&lt;p&gt;This isn't just another incremental update. It's proof that &lt;strong&gt;post-training scaling&lt;/strong&gt; can be more impactful than pre-training scaling, challenging the multi-billion dollar arms race that has dominated AI development for years.&lt;/p&gt;




&lt;h2&gt;
  
  
  What Is Post-Training Scaling?
&lt;/h2&gt;

&lt;p&gt;Post-training scaling refers to improvements made after a model's initial pre-training is complete. Instead of adding more parameters or training data, Z.ai focused on:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Better Training Methods:&lt;/strong&gt; Optimizing how the model learns from existing data&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Improved Data Quality:&lt;/strong&gt; Enhancing the training dataset without increasing its size&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Larger-Scale Reinforcement Learning:&lt;/strong&gt; Expanding the RL training scope&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Z.ai's own description: &lt;em&gt;"The textbook didn't change, but we found better teaching methods."&lt;/em&gt;&lt;/p&gt;




&lt;h2&gt;
  
  
  The Technical Stack
&lt;/h2&gt;

&lt;p&gt;GLM-5.3's improvements rest on three key components:&lt;/p&gt;

&lt;h3&gt;
  
  
  1. IndexShare
&lt;/h3&gt;

&lt;p&gt;An efficient long-context processing architecture that prevents information loss in extended tasks.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. SAO (Single-rollout Asynchronous Optimization)
&lt;/h3&gt;

&lt;p&gt;A reinforcement learning algorithm designed for long-horizon tasks, enabling the model to learn from complete trajectories rather than single-step predictions.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. Slime
&lt;/h3&gt;

&lt;p&gt;A large-scale asynchronous reinforcement learning training framework that brings training efficiency to industrial scale.&lt;/p&gt;




&lt;h2&gt;
  
  
  Benchmark Results
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;GLM-5.2&lt;/th&gt;
&lt;th&gt;GLM-5.3&lt;/th&gt;
&lt;th&gt;Industry Position&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;CyberGym (Vulnerability Detection)&lt;/td&gt;
&lt;td&gt;77.2%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;84.5%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;#1 Globally&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ExploitBench (Exploit Reasoning)&lt;/td&gt;
&lt;td&gt;24.4%&lt;/td&gt;
&lt;td&gt;54.4%&lt;/td&gt;
&lt;td&gt;Behind Mythos 5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Terminal-Bench 3.0&lt;/td&gt;
&lt;td&gt;4.6&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;28.3&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;#1 Open Source&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSWE v1.1&lt;/td&gt;
&lt;td&gt;46.2&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;66.9&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;#1 Open Source&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GDPval-AA v2&lt;/td&gt;
&lt;td&gt;15081&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;17694&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Surpasses Kimi K3&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;strong&gt;Key Insight:&lt;/strong&gt; GLM-5.3 dominates vulnerability detection (CyberGym 84.5%) but lags in exploit reasoning (ExploitBench 54.4% vs Mythos 5's 78.0%). This suggests the model is stronger at &lt;em&gt;identifying&lt;/em&gt; vulnerabilities than &lt;em&gt;exploiting&lt;/em&gt; them.&lt;/p&gt;




&lt;h2&gt;
  
  
  The 40-Year DNS Bug Discovery
&lt;/h2&gt;

&lt;p&gt;In a remarkable demonstration, GLM-5.3 identified a DNS protocol bug that had潜伏 (lay dormant) for over 40 years, dating back to 1983. This was part of a larger effort across 269 real-world projects, where the model discovered 2,436 vulnerabilities.&lt;/p&gt;

&lt;p&gt;This isn't just a benchmark exercise—it's real-world impact. A 40-year-old bug in DNS could affect internet infrastructure globally.&lt;/p&gt;




&lt;h2&gt;
  
  
  Open Source Plans
&lt;/h2&gt;

&lt;p&gt;Z.ai announced that GLM-5.3 weights will be open-sourced within two weeks, accompanied by:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;"Trusted Access" Program:&lt;/strong&gt; Controlled access to model capabilities&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;"Open Source Shield" Initiative:&lt;/strong&gt; Community-driven security and governance&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;This positions GLM-5.3 as the most powerful open-source coding model available, potentially shifting the competitive landscape.&lt;/p&gt;




&lt;h2&gt;
  
  
  Industry Implications
&lt;/h2&gt;

&lt;h3&gt;
  
  
  For Developers
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;GLM-5.3 offers coding performance approaching Claude Fable 5 and GPT-5.6 Sol&lt;/li&gt;
&lt;li&gt;Token efficiency is significantly better: ~50K tokens per task vs ~120K for Opus 4.8&lt;/li&gt;
&lt;li&gt;The model is best suited for code review, vulnerability detection, and long-horizon software engineering&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  For the AI Industry
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Post-training &amp;gt; Pre-training:&lt;/strong&gt; The GLM-5.3 case suggests that training method innovation may be more valuable than parameter scaling&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Cost Efficiency:&lt;/strong&gt; Same base model, better performance = lower inference costs&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Open Source Advantage:&lt;/strong&gt; When weights are released, GLM-5.3 could become the default for many applications&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  Code Example: Using GLM-5.3 for Code Review
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;zhipuai&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;zhipuai&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;ZhipuAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;your-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;glm-5.3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"""&lt;/span&gt;&lt;span class="s"&gt;
Review this Python code for security vulnerabilities:

&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;

&lt;p&gt;&lt;br&gt;
python&lt;br&gt;
def process_user_input(user_data):&lt;br&gt;
    import os&lt;br&gt;
    os.system(f"echo {user_data}")&lt;br&gt;
    return True&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;
Identify all vulnerabilities and suggest fixes.
"""
         }
     ],
    max_tokens=2000
)

print(response.choices[0].message.content)
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;






&lt;h2&gt;
  
  
  The Honest Boundaries
&lt;/h2&gt;

&lt;p&gt;Z.ai is transparent about limitations:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Weights Not Yet Released:&lt;/strong&gt; All benchmarks are vendor-reported, not independently verified&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Identification vs. Exploitation Gap:&lt;/strong&gt; Strong at finding vulnerabilities, weaker at exploiting them&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Access Restrictions:&lt;/strong&gt; Some capabilities may be restricted even after open-source release&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  Conclusion: Three Takeaways
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Post-training scaling is a viable alternative to pre-training scaling.&lt;/strong&gt; The GLM-5.3 case proves that training method innovation can deliver significant gains without increasing model size.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Open source will reshape the competitive landscape.&lt;/strong&gt; When GLM-5.3 weights are released, it could become the default for many coding and security tasks.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;The AI industry is maturing.&lt;/strong&gt; From "more parameters = better" to "better training = better," the industry is moving toward more sophisticated approaches.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;&lt;em&gt;This article is based on information published by Z.ai on August 14, 2026, and subsequent community analysis. All benchmark figures are vendor-reported unless otherwise noted.&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>machinelearning</category>
      <category>cybersecurity</category>
      <category>opensource</category>
    </item>
    <item>
      <title>DeepSeek V4.1 Flash: The Native Multimodal Model That's Breaking Speed Records</title>
      <dc:creator>ryan2run</dc:creator>
      <pubDate>Wed, 09 Sep 2026 23:15:15 +0000</pubDate>
      <link>https://dev.to/ryan_zhao/deepseek-v41-flash-the-native-multimodal-model-thats-breaking-speed-records-1ged</link>
      <guid>https://dev.to/ryan_zhao/deepseek-v41-flash-the-native-multimodal-model-thats-breaking-speed-records-1ged</guid>
      <description>&lt;h1&gt;
  
  
  DeepSeek V4.1 Flash: The Native Multimodal Model That's Breaking Speed Records
&lt;/h1&gt;

&lt;h2&gt;
  
  
  How DeepSeek Achieved 420 Tokens/Second Without Sacrificing Accuracy
&lt;/h2&gt;

&lt;p&gt;&lt;em&gt;Published: September 9, 2026 | Reading time: 10 minutes&lt;/em&gt;&lt;/p&gt;




&lt;h2&gt;
  
  
  The Surprise Beta
&lt;/h2&gt;

&lt;p&gt;On September 8, 2026, DeepSeek quietly launched a beta test for V4.1 Flash, an intermediate model with the identifier &lt;code&gt;deepseek-v4.1-flash-expires-on-0910&lt;/code&gt;. The model name itself reveals the urgency—this beta expires on September 10, giving developers just 48 hours to test it.&lt;/p&gt;

&lt;p&gt;What makes this launch remarkable isn't just the speed. It's that V4.1 Flash is DeepSeek's &lt;strong&gt;first native multimodal model&lt;/strong&gt;, supporting both text and image input/output from the factory, not as an afterthought.&lt;/p&gt;




&lt;h2&gt;
  
  
  Performance Benchmarks
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;Speed Improvement&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;49K Long Context Retrieval&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;5.2x faster&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;SVG Code Generation&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;6.0x faster&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Manacher Palindrome Algorithm&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;4.6x faster&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Complex SQL Query Generation&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;5.0x faster&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Asyncio Architecture Refactoring&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;3.9x faster&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;strong&gt;Peak Performance:&lt;/strong&gt; 420 tokens/second in long-text reasoning tasks, with end-to-end throughput reaching 409.5 tokens/second.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Real-World Test:&lt;/strong&gt; A user sent a photo of a person in a striped suit. The model correctly identified the striped pattern, avoiding the hallucination issues that plagued earlier vision models.&lt;/p&gt;




&lt;h2&gt;
  
  
  The Architecture: What's New?
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Native Multimodal Support
&lt;/h3&gt;

&lt;p&gt;Unlike V4 Flash Vision-Exp, which added a visual encoder as an "external plugin" on top of a text-only base, V4.1 Flash integrates text and image processing from the ground up. This means:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Unified Representation:&lt;/strong&gt; Text and images share the same latent space&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Better Cross-Modal Reasoning:&lt;/strong&gt; The model can reason across modalities more effectively&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Lower Latency:&lt;/strong&gt; No need to coordinate separate encoders and decoders&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  New Model Structure
&lt;/h3&gt;

&lt;p&gt;DeepSeek claims V4.1 Flash uses a "new model structure," but hasn't released a technical report. Community analysis suggests:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Improved Attention Mechanism:&lt;/strong&gt; Likely building on CSA/HCA hybrid attention from V4&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Optimized Routing:&lt;/strong&gt; Better expert selection in the MoE architecture&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Enhanced Multimodal Fusion:&lt;/strong&gt; Deeper integration of visual and text features&lt;/li&gt;
&lt;/ol&gt;




&lt;h2&gt;
  
  
  The Engineering Challenge
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Why 150 New Engineers?
&lt;/h3&gt;

&lt;p&gt;DeepSeek simultaneously announced hiring 150 senior engineers, focusing on:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Backend Development:&lt;/strong&gt; Model research platforms, Agent frameworks, API infrastructure&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Agent Computing:&lt;/strong&gt; Platform development, low-level optimization, elastic computing&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;As Cui Tianyi, DeepSeek Harness负责人, explained:&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;"When quantity increases, complexity explodes exponentially. Data volume, machine/container count, training tasks, evaluation tasks, Agent environments, user count, request volume—all are increasing dramatically. This creates complexity that old backend systems can't handle."&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h3&gt;
  
  
  The Real-World Impact
&lt;/h3&gt;

&lt;p&gt;V4.1 Flash's speed isn't just a benchmark achievement. It enables:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Real-Time Multimodal Interaction:&lt;/strong&gt; Users can send images and receive responses in under a second&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Complex Agent Workflows:&lt;/strong&gt; The model can handle multi-step tasks with dynamic environments&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Cost Efficiency:&lt;/strong&gt; Same pricing as V4 Flash, but with better performance&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  Code Example: Multimodal Input
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;your-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.deepseek.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="c1"&gt;# Send an image with text prompt
&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;deepseek-v4.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
         &lt;span class="p"&gt;{&lt;/span&gt;
              &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
              &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                  &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;What is the person wearing in this image?&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
                  &lt;span class="p"&gt;{&lt;/span&gt;
                      &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                      &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                          &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://example.com/person.jpg&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
                      &lt;span class="p"&gt;}&lt;/span&gt;
                  &lt;span class="p"&gt;}&lt;/span&gt;
              &lt;span class="p"&gt;]&lt;/span&gt;
          &lt;span class="p"&gt;}&lt;/span&gt;
      &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;500&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;






&lt;h2&gt;
  
  
  The Pricing Advantage
&lt;/h2&gt;

&lt;p&gt;Despite the performance improvements, V4.1 Flash maintains the same pricing as V4 Flash. This is significant because:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Competitive Pressure:&lt;/strong&gt; Other models are charging more for similar or worse performance&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Market Disruption:&lt;/strong&gt; DeepSeek is using price to gain market share&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Sustainability:&lt;/strong&gt; The new architecture is more efficient, allowing lower prices&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Community reaction: When performance is high and price is low, Liang Wenfeng (DeepSeek's founder) becomes "梁圣" (Saint Liang). When prices rise, he becomes "梁子" (Little Liang). With V4.1 Flash, he's back to being 梁圣.&lt;/p&gt;




&lt;h2&gt;
  
  
  The Beta Limitations
&lt;/h2&gt;

&lt;h3&gt;
  
  
  What We Know
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Intermediate Version:&lt;/strong&gt; This is not the final release; it expires on September 10&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;No Technical Report:&lt;/strong&gt; DeepSeek hasn't published detailed architecture documentation&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Limited Access:&lt;/strong&gt; Only available through beta testing, not public API&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  What We Don't Know
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Exact model architecture details&lt;/li&gt;
&lt;li&gt;Full benchmark results across all tasks&lt;/li&gt;
&lt;li&gt;Long-term stability and reliability data&lt;/li&gt;
&lt;li&gt;Final pricing strategy for the public release&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  Industry Context
&lt;/h2&gt;

&lt;h3&gt;
  
  
  The AI Race Is Heating Up
&lt;/h3&gt;

&lt;p&gt;In the past month, Chinese AI models have been released at an unprecedented pace:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;July:&lt;/strong&gt; Kimi K3 open-sourced, Qwen3.8-Max released&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;August:&lt;/strong&gt; GLM-5.3 released, DeepSeek V4 Pro launched&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;September:&lt;/strong&gt; DeepSeek V4.1 Flash beta, V4.1 Pro expected&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;This "weekly release" rhythm is unprecedented in the AI industry.&lt;/p&gt;

&lt;h3&gt;
  
  
  The Competition
&lt;/h3&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Release Date&lt;/th&gt;
&lt;th&gt;Key Feature&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Kimi K3&lt;/td&gt;
&lt;td&gt;July 2026&lt;/td&gt;
&lt;td&gt;2.8T parameters, native multimodal&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GLM-5.3&lt;/td&gt;
&lt;td&gt;August 2026&lt;/td&gt;
&lt;td&gt;Post-training scaling, cyber security&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSeek V4 Pro&lt;/td&gt;
&lt;td&gt;August 2026&lt;/td&gt;
&lt;td&gt;Million-token context, DSA attention&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;DeepSeek V4.1 Flash&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;September 2026&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;Native multimodal, 420 tok/s&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;




&lt;h2&gt;
  
  
  What's Next?
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Expected Timeline
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;September 10:&lt;/strong&gt; V4.1 Flash public release (tentative)&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;September 2026:&lt;/strong&gt; V4.1 Pro release (expected)&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Late 2026:&lt;/strong&gt; Next-generation models (speculative)&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  What to Watch
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;V4.1 Flash Public API:&lt;/strong&gt; When it launches, expect massive adoption&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;V4.1 Pro Performance:&lt;/strong&gt; How much better than Flash?&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Pricing Strategy:&lt;/strong&gt; Will DeepSeek maintain low prices?&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ecosystem Development:&lt;/strong&gt; Tools, frameworks, and integrations&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  Code Example: Performance Testing
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;your-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.deepseek.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;benchmark_model&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;prompt&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;deepseek-v4.1-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="n"&gt;start&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;time&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
    &lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
        &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;prompt&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
        &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;1000&lt;/span&gt;
     &lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;end&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;time&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

    &lt;span class="n"&gt;tokens&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;split&lt;/span&gt;&lt;span class="p"&gt;())&lt;/span&gt;
    &lt;span class="n"&gt;duration&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;end&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="n"&gt;start&lt;/span&gt;
    &lt;span class="n"&gt;tps&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;tokens&lt;/span&gt; &lt;span class="o"&gt;/&lt;/span&gt; &lt;span class="n"&gt;duration&lt;/span&gt;

    &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Model: &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Tokens: &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;tokens&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Duration: &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;duration&lt;/span&gt;&lt;span class="si"&gt;:&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;s&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Tokens/Second: &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;tps&lt;/span&gt;&lt;span class="si"&gt;:&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;tps&lt;/span&gt;

&lt;span class="c1"&gt;# Test with a complex prompt
&lt;/span&gt;&lt;span class="n"&gt;benchmark_model&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"""&lt;/span&gt;&lt;span class="s"&gt;
Analyze the following code for performance issues:

&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;

&lt;p&gt;&lt;br&gt;
python&lt;br&gt;
def process_large_dataset(data):&lt;br&gt;
    results = []&lt;br&gt;
    for item in data:&lt;br&gt;
        result = complex_calculation(item)&lt;br&gt;
        results.append(result)&lt;br&gt;
    return results&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;
Provide specific optimization suggestions with code examples.
""")
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;






&lt;h2&gt;
  
  
  Conclusion: Why This Matters
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Speed Is a Feature:&lt;/strong&gt; 420 tokens/second isn't just a benchmark—it enables real-time interaction that was previously impossible.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Multimodal Is the Future:&lt;/strong&gt; Native multimodal support means better cross-modal reasoning and lower latency.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Price War Is Real:&lt;/strong&gt; DeepSeek is using low prices to gain market share, forcing competitors to respond.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Open Source Will Follow:&lt;/strong&gt; When V4.1 Flash weights are released (if they are), it could become the default for many applications.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;&lt;em&gt;This article is based on information from DeepSeek's beta announcement on September 8, 2026, and community testing reports. All benchmark figures are from community testing unless otherwise noted. The model is currently in beta and expires on September 10, 2026.&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>deepseek</category>
      <category>multimodal</category>
      <category>performance</category>
    </item>
    <item>
      <title>Kimi K3: The 2.8 Trillion Parameter AI Model That's Changing Everything</title>
      <dc:creator>ryan2run</dc:creator>
      <pubDate>Wed, 09 Sep 2026 23:01:07 +0000</pubDate>
      <link>https://dev.to/ryan_zhao/kimi-k3-the-28-trillion-parameter-ai-model-thats-changing-everything-2gn5</link>
      <guid>https://dev.to/ryan_zhao/kimi-k3-the-28-trillion-parameter-ai-model-thats-changing-everything-2gn5</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3: The 2.8 Trillion Parameter AI Model That's Changing Everything
&lt;/h1&gt;

&lt;blockquote&gt;
&lt;p&gt;Deep dive into China's most powerful AI model — with practical coding examples and benchmarks&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  The Breakthrough 🎯
&lt;/h2&gt;

&lt;p&gt;Kimi K3 is a 2.8 trillion parameter foundation model that's pushing the boundaries of AI capabilities. Built with proprietary KDA hybrid linear attention and attention residual mechanisms, it delivers:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;1 Million Token Context Window&lt;/strong&gt; — Process entire codebases in one go&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Native Multimodal Support&lt;/strong&gt; — Understand text, images, and documents&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Long-Term Agent Capabilities&lt;/strong&gt; — Execute complex multi-step workflows&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Engineering-Grade Coding&lt;/strong&gt; — Full software development lifecycle support&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Architecture Deep Dive 🧠
&lt;/h2&gt;

&lt;h3&gt;
  
  
  KDA Hybrid Linear Attention
&lt;/h3&gt;

&lt;p&gt;Traditional attention mechanisms scale quadratically with sequence length, making million-token contexts computationally expensive. KDA hybrid linear attention solves this by:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Efficient Compression:&lt;/strong&gt; Stores historical context without full attention computation&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Residual Optimization:&lt;/strong&gt; Preserves key information across layers&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Sparse Mixture of Experts:&lt;/strong&gt; Balances total parameters with actual compute cost&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  Practical Impact
&lt;/h3&gt;

&lt;p&gt;This means you can now:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Process entire codebases without splitting&lt;/li&gt;
&lt;li&gt;Analyze hundreds of contract pages at once&lt;/li&gt;
&lt;li&gt;Read dozens of industry reports simultaneously&lt;/li&gt;
&lt;li&gt;Combine images, documents, and text for joint reasoning&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Real-World Benchmarks 📈
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Score&lt;/th&gt;
&lt;th&gt;Industry Position&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;SWE-Marathon&lt;/td&gt;
&lt;td&gt;42.0&lt;/td&gt;
&lt;td&gt;Top Tier&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;TerminalBench&lt;/td&gt;
&lt;td&gt;88.3&lt;/td&gt;
&lt;td&gt;Leading&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BrowseComp&lt;/td&gt;
&lt;td&gt;91.2&lt;/td&gt;
&lt;td&gt;Leading&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Frontend CodeArena&lt;/td&gt;
&lt;td&gt;Top Rank&lt;/td&gt;
&lt;td&gt;Elite&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  Code Examples 💻
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Long Document Analysis with Context Caching
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;dotenv&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;load_dotenv&lt;/span&gt;

&lt;span class="nf"&gt;load_dotenv&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;os&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;getenv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;KIMI_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.moonshot.cn/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;full_document_text&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"""&lt;/span&gt;&lt;span class="s"&gt;Paste long document text here&lt;/span&gt;&lt;span class="sh"&gt;"""&lt;/span&gt;

&lt;span class="n"&gt;resp&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;system&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;You are a professional document analysis assistant.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
         &lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Analyze all risks in this document:&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;full_document_text&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
         &lt;span class="p"&gt;}&lt;/span&gt;
     &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;8192&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.3&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;top_p&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.8&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;False&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;resp&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Custom Tool Calling for Agent Workflows
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;dotenv&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;load_dotenv&lt;/span&gt;

&lt;span class="nf"&gt;load_dotenv&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;os&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;getenv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;KIMI_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.moonshot.cn/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;tools&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="p"&gt;{&lt;/span&gt;
         &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;function&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
         &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;function&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;name&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;read_project_log&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;description&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Read project log file to identify errors&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parameters&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                 &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;object&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                 &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;properties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                     &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;log_file_path&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                         &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;string&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                         &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;description&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Local path to log file&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
                     &lt;span class="p"&gt;}&lt;/span&gt;
                 &lt;span class="p"&gt;},&lt;/span&gt;
                 &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;required&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;log_file_path&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
                 &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;additionalProperties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="bp"&gt;False&lt;/span&gt;
             &lt;span class="p"&gt;}&lt;/span&gt;
         &lt;span class="p"&gt;}&lt;/span&gt;
     &lt;span class="p"&gt;}&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;span class="n"&gt;agent_response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
             &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Read app.log and suggest optimizations&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
         &lt;span class="p"&gt;}&lt;/span&gt;
     &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;tools&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;tools&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;tool_choice&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;auto&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4096&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;dumps&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;agent_response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;model_dump&lt;/span&gt;&lt;span class="p"&gt;(),&lt;/span&gt; &lt;span class="n"&gt;ensure_ascii&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;indent&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;2&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Agent Capabilities 🤖
&lt;/h2&gt;

&lt;p&gt;Kimi K3 supports full agent workflows:&lt;/p&gt;

&lt;h3&gt;
  
  
  Plan Mode
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Model researches and outputs complete plan&lt;/li&gt;
&lt;li&gt;Waits for developer confirmation&lt;/li&gt;
&lt;li&gt;Executes only after approval&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Goal Mode
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Define task objectives and completion criteria&lt;/li&gt;
&lt;li&gt;Model iterates until goal is met&lt;/li&gt;
&lt;li&gt;Minimal human intervention needed&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Built-in Tools
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Web search&lt;/li&gt;
&lt;li&gt;Web scraping&lt;/li&gt;
&lt;li&gt;Code sandbox execution&lt;/li&gt;
&lt;li&gt;Table processing&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Custom Tools
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Local file I/O&lt;/li&gt;
&lt;li&gt;Database queries&lt;/li&gt;
&lt;li&gt;Business API integration&lt;/li&gt;
&lt;li&gt;Custom automation workflows&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  The Bottom Line 🎯
&lt;/h2&gt;

&lt;p&gt;Kimi K3 represents a significant leap forward in AI capabilities. With its 2.8 trillion parameters, million-token context window, and native agent support, it's positioned as one of the most powerful AI models available today.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Key Takeaways:&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;✅ Massive context window for large codebases&lt;/li&gt;
&lt;li&gt;✅ Native multimodal understanding&lt;/li&gt;
&lt;li&gt;✅ Full agent workflow support&lt;/li&gt;
&lt;li&gt;✅ Engineering-grade coding capabilities&lt;/li&gt;
&lt;li&gt;✅ Practical API integration&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;em&gt;Have you tried Kimi K3? What's your experience with large language models? Share your thoughts in the comments!&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>kimi</category>
      <category>llm</category>
      <category>programming</category>
    </item>
    <item>
      <title>GPT-6 Astra: The AI That Can Actually Use Your Computer</title>
      <dc:creator>ryan2run</dc:creator>
      <pubDate>Wed, 09 Sep 2026 23:00:33 +0000</pubDate>
      <link>https://dev.to/ryan_zhao/gpt-6-astra-the-ai-that-can-actually-use-your-computer-3lm6</link>
      <guid>https://dev.to/ryan_zhao/gpt-6-astra-the-ai-that-can-actually-use-your-computer-3lm6</guid>
      <description>&lt;h1&gt;
  
  
  GPT-6 Astra: The AI That Can Actually Use Your Computer
&lt;/h1&gt;

&lt;blockquote&gt;
&lt;p&gt;OpenAI's latest model goes beyond code — it operates software like a human&lt;/p&gt;
&lt;/blockquote&gt;

&lt;h2&gt;
  
  
  The Game Changer 🚀
&lt;/h2&gt;

&lt;p&gt;OpenAI's GPT-6 Astra represents a fundamental shift in AI capabilities. Released in September 2026, it's not just another language model — it's an AI that can actually interact with your computer.&lt;/p&gt;

&lt;h3&gt;
  
  
  What Makes It Different
&lt;/h3&gt;

&lt;p&gt;Unlike previous models that could only generate text or code, GPT-6 Astra can:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Operate Software&lt;/strong&gt; — Click buttons, navigate menus, fill forms&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Understand Screens&lt;/strong&gt; — Read UI elements, interpret visuals&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Execute Tasks&lt;/strong&gt; — Complete multi-step workflows autonomously&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Learn from Feedback&lt;/strong&gt; — Adjust behavior based on results&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Computer Use: The Breakthrough Feature 💻
&lt;/h2&gt;

&lt;p&gt;The most exciting capability is Computer Use — the ability to operate software interfaces like a human would.&lt;/p&gt;

&lt;h3&gt;
  
  
  Real-World Examples
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Design Software:&lt;/strong&gt; Operate Photoshop faster than humans&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Development Tools:&lt;/strong&gt; Navigate IDEs, run commands, debug code&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Web Browsers:&lt;/strong&gt; Search, fill forms, extract data&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Desktop Apps:&lt;/strong&gt; Manage files, configure settings, automate tasks&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  Performance Benchmarks
&lt;/h3&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;GPT-6 Astra&lt;/th&gt;
&lt;th&gt;Human Average&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Photoshop Operations&lt;/td&gt;
&lt;td&gt;Faster&lt;/td&gt;
&lt;td&gt;Baseline&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Code Debugging&lt;/td&gt;
&lt;td&gt;95% success&lt;/td&gt;
&lt;td&gt;80% success&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Web Navigation&lt;/td&gt;
&lt;td&gt;90% success&lt;/td&gt;
&lt;td&gt;85% success&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;File Management&lt;/td&gt;
&lt;td&gt;92% success&lt;/td&gt;
&lt;td&gt;88% success&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  Coding Capabilities 🎯
&lt;/h2&gt;

&lt;p&gt;GPT-6 Astra excels at coding tasks:&lt;/p&gt;

&lt;h3&gt;
  
  
  Software Engineering
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Full project development&lt;/li&gt;
&lt;li&gt;Bug fixing and debugging&lt;/li&gt;
&lt;li&gt;Code refactoring&lt;/li&gt;
&lt;li&gt;Test writing and execution&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Research Applications
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Mathematical problem solving&lt;/li&gt;
&lt;li&gt;Scientific analysis&lt;/li&gt;
&lt;li&gt;Data processing&lt;/li&gt;
&lt;li&gt;Algorithm design&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Practical Examples
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="c1"&gt;# Example: Automated Code Review
&lt;/span&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gpt-6-astra&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Review this code for bugs&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
      &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.2&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  The Bigger Picture 🌍
&lt;/h2&gt;

&lt;p&gt;GPT-6 Astra represents a shift from "AI that talks" to "AI that acts." This has huge implications:&lt;/p&gt;

&lt;h3&gt;
  
  
  For Developers
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Automated code review&lt;/li&gt;
&lt;li&gt;Bug fixing assistance&lt;/li&gt;
&lt;li&gt;Documentation generation&lt;/li&gt;
&lt;li&gt;Testing automation&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  For Businesses
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Process automation&lt;/li&gt;
&lt;li&gt;Data analysis&lt;/li&gt;
&lt;li&gt;Report generation&lt;/li&gt;
&lt;li&gt;Customer support&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  For Researchers
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;Literature review&lt;/li&gt;
&lt;li&gt;Data processing&lt;/li&gt;
&lt;li&gt;Experiment design&lt;/li&gt;
&lt;li&gt;Result analysis&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Pricing &amp;amp; Availability 💰
&lt;/h2&gt;

&lt;p&gt;OpenAI has adopted a task-based pricing model rather than token-based:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Simple Tasks:&lt;/strong&gt; $0.01-$0.10 per task&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Complex Workflows:&lt;/strong&gt; $0.50-$5.00 per task&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Enterprise Plans:&lt;/strong&gt; Custom pricing&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  The Bottom Line 🎯
&lt;/h2&gt;

&lt;p&gt;GPT-6 Astra is a significant step toward practical AI assistance. While it's not perfect, it's already useful for many real-world tasks.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Key Takeaways:&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;✅ Can operate software interfaces&lt;/li&gt;
&lt;li&gt;✅ Excels at coding tasks&lt;/li&gt;
&lt;li&gt;✅ Useful for automation&lt;/li&gt;
&lt;li&gt;✅ Task-based pricing is fair&lt;/li&gt;
&lt;li&gt;⚠️ Still has limitations&lt;/li&gt;
&lt;/ul&gt;




&lt;p&gt;&lt;em&gt;Have you tried GPT-6 Astra? What tasks do you use it for? Share your experience in the comments!&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>gpt</category>
      <category>openai</category>
      <category>programming</category>
    </item>
  </channel>
</rss>
