<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Khuram Youraj</title>
    <description>The latest articles on DEV Community by Khuram Youraj (@khuram_youraj_6c4b6780ae1).</description>
    <link>https://dev.to/khuram_youraj_6c4b6780ae1</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4033447%2F6065dc36-23e3-411d-a016-a87667946b27.png</url>
      <title>DEV Community: Khuram Youraj</title>
      <link>https://dev.to/khuram_youraj_6c4b6780ae1</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/khuram_youraj_6c4b6780ae1"/>
    <language>en</language>
    <item>
      <title>DeepSeek V4 Pro 0813 发布：新一代混合推理大模型带来哪些升级与行业影响</title>
      <dc:creator>Khuram Youraj</dc:creator>
      <pubDate>Sun, 16 Aug 2026 03:31:18 +0000</pubDate>
      <link>https://dev.to/khuram_youraj_6c4b6780ae1/deepseek-v4-pro-0813-fa-bu-xin-dai-hun-he-tui-li-da-mo-xing-dai-lai-na-xie-sheng-ji-yu-xing-ye-ying-xiang-d25</link>
      <guid>https://dev.to/khuram_youraj_6c4b6780ae1/deepseek-v4-pro-0813-fa-bu-xin-dai-hun-he-tui-li-da-mo-xing-dai-lai-na-xie-sheng-ji-yu-xing-ye-ying-xiang-d25</guid>
      <description>&lt;p&gt;一个多月前，行业还在争论「R1 式深度思考链」是否是推理问题的万能解；这一次，DeepSeek 给出的答案是第三种路径——把「快」和「深」同时装进一个模型，而不是让用户二选一。&lt;/p&gt;

&lt;p&gt;2026 年 8 月 13 日，深度求索（DeepSeek）正式发布新一代旗舰模型 &lt;strong&gt;DeepSeek V4 Pro 0813&lt;/strong&gt;，同步开放 API 与开源权重下载。这是继 V3、R1、V4 基础版之后，DeepSeek 在通用对话、代码生成与深度推理三条线上首次「三合一」的旗舰版本，官方定位为面向企业与开发者的规模化生产级模型。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;读完本文，你可以得到三个判断：&lt;/strong&gt; V4 Pro 0813 相比前代到底改了什么、对你的项目是否值得升级、以及如何用 10 分钟做一次低成本的迁移前验证。&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;需要先说明的是：截至本文发布，官方尚未公布完整技术报告。文中涉及的参数量、基准分数与部分架构细节，均为综合官方口径、社区测试与公开信息的合理推测，最终请以官方正式技术报告为准。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;p&gt;本篇文章按「发布事实 → 前代对比 → 行业影响 → 落地建议 → 后续展望」展开。&lt;/p&gt;

&lt;h2&gt;
  
  
  一、发布事实：时间线、版本号与开放方式
&lt;/h2&gt;

&lt;p&gt;据官方公告，DeepSeek V4 Pro 0813 于北京时间 2026 年 8 月 13 日上午开放灰度，8 月 14 日起全量上线。版本号中的「0813」对应发布日期，延续了 DeepSeek 一贯的「以日命名」快节奏迭代惯例。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;开放渠道&lt;/strong&gt;：网页端、移动端、OpenAPI、企业私有化部署包同时上线。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;开源情况&lt;/strong&gt;：权重、基础版工具链及推理服务端代码同步开源，API 计费与 V4 基础版持平（官方口径）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;上下文窗口&lt;/strong&gt;：128K 原生支持，可通过长文本接口扩展至 1M（官方口径）。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;首批上线语言&lt;/strong&gt;：中英文；德语、日语、韩语计划在灰度第二阶段跟进（官方口径，具体上线时间未公布）。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;官方给出的核心口径是「更快、更省、更稳」：据官方称，首 token 延迟相比 V4 基础版下降约 40%，推理成本维持较低区间，并针对企业高频场景加强了多轮一致性。以上数据均为官方发布会口径，尚未经独立第三方复测验证。&lt;/p&gt;

&lt;h2&gt;
  
  
  二、相比前代（V3 / R1 / V4）的升级点：规格与能力对比
&lt;/h2&gt;

&lt;p&gt;时间线和开放方式只是表象。要判断这次发布的分量，关键在于它相比前代到底改了什么——把它放进 DeepSeek 三代产品的演进脉络里，才能看出「三合一」的含义。&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;DeepSeek V3&lt;/th&gt;
&lt;th&gt;DeepSeek R1&lt;/th&gt;
&lt;th&gt;DeepSeek V4&lt;/th&gt;
&lt;th&gt;V4 Pro 0813&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;定位&lt;/td&gt;
&lt;td&gt;通用对话&lt;/td&gt;
&lt;td&gt;纯推理&lt;/td&gt;
&lt;td&gt;通用+推理&lt;/td&gt;
&lt;td&gt;通用+推理+Agent 协同&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;参数量（推测）&lt;/td&gt;
&lt;td&gt;671B MoE&lt;/td&gt;
&lt;td&gt;推理导向&lt;/td&gt;
&lt;td&gt;约 1.4T MoE&lt;/td&gt;
&lt;td&gt;约 1.6T MoE&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;推理能力&lt;/td&gt;
&lt;td&gt;中&lt;/td&gt;
&lt;td&gt;强&lt;/td&gt;
&lt;td&gt;强&lt;/td&gt;
&lt;td&gt;强（重点提升方向）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Agent / 工具调用&lt;/td&gt;
&lt;td&gt;弱&lt;/td&gt;
&lt;td&gt;弱&lt;/td&gt;
&lt;td&gt;中&lt;/td&gt;
&lt;td&gt;强&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;多轮一致性&lt;/td&gt;
&lt;td&gt;中&lt;/td&gt;
&lt;td&gt;中&lt;/td&gt;
&lt;td&gt;中&lt;/td&gt;
&lt;td&gt;高&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;部署成本&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;td&gt;低&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;blockquote&gt;
&lt;p&gt;需要特别说明：上表参数量与能力评级，是基于公开信息的合理推测，&lt;strong&gt;不是官方确认数据&lt;/strong&gt;，应以官方最终技术报告为准。&lt;/p&gt;
&lt;/blockquote&gt;

&lt;p&gt;&lt;strong&gt;具体升级方向上，官方口径与社区测试主要聚焦四点：&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;1. 混合推理架构——本次升级的核心变化。&lt;/strong&gt; 与 R1 强制走深度思考链不同，V4 Pro 0813 据称可在同一模型中动态切换「快推理」与「深度思考」模式：复杂数学与代码题自动进入思考态，简单问答直接快速输出。从社区技术拆解看，这一能力或不止于简单的开关切换，更可能是在 MoE 的专家路由层引入轻量的意图预判，根据输入复杂度动态分配计算资源——这也是它能同时压低延迟、又维持推理质量的可能原因（具体实现以官方报告为准）。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2. 代码与工程能力。&lt;/strong&gt; 据官方与社区测试，在 Codeforces、HumanEval、SWE-bench 等基准上均有提升，尤其在长文件理解与多文件项目级改造上优势明显。具体分数尚未公布，有待技术报告验证。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3. Agent 工具调用。&lt;/strong&gt; 这是相对 V4 最显著的进步点，支持更复杂的多工具编排、结构化输出与错误自恢复，更适合接入 CRUD、自动化脚本与工作流。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;4. 长上下文与多轮记忆。&lt;/strong&gt; 128K 原生 + 1M 扩展，长文档问答中的事实保持能力据称大幅增强。&lt;/p&gt;

&lt;h2&gt;
  
  
  三、对行业与 AI 竞争格局的影响
&lt;/h2&gt;

&lt;p&gt;单看一张对比表，还不足以判断它的真实分量。把视角拉远到整个行业，V4 Pro 0813 的意义更清晰——它把「高性能 + 低推理成本」的竞争，再次推向白热化。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;对同类闭源大模型&lt;/strong&gt;：以更低 token 价格提供接近顶尖水平的推理与代码能力，直接冲击以「订阅制 + 按 token 高价」为模式的商业模型，可能倒逼对手降价或开放更多免费额度。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;对开源社区&lt;/strong&gt;：作为可本地部署的大规模 MoE 模型，为中小团队提供了「不依赖大厂云也能自建」的路径，有望进一步加速开源模型在垂直行业的落地。&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;对推理成本定价体系&lt;/strong&gt;：据官方口径，首 token 延迟下降而成本持平，意味着「快」不再以「贵」为代价，这可能重塑 API 定价与边缘部署的默认选择。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;对国内 AI 企业而言，这可能意味着一轮新的「对标与内卷」：竞争维度正从拼参数、拼基准，转向拼工程化、拼 Agent 生态与落地效率。需要说明的是，上述影响均为基于现有信息的趋势研判，实际竞争格局变化仍需观察。&lt;/p&gt;

&lt;h2&gt;
  
  
  四、开发者与用户视角：何时该升级、何时不需要
&lt;/h2&gt;

&lt;p&gt;理解了行业影响，下一个自然的问题是：&lt;strong&gt;这些能力和我有关吗？&lt;/strong&gt; 对开发者来说，V4 Pro 0813 是否值得升级，取决于你的具体场景，而不是「追新」。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;适合立即升级的场景：&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;需要复杂代码生成、多文件工程级改造的开发者&lt;/li&gt;
&lt;li&gt;正在搭建 Agent / 工作流 / 自动化脚本的团队&lt;/li&gt;
&lt;li&gt;对多轮一致性敏感的企业客服、文档问答系统&lt;/li&gt;
&lt;li&gt;需要长文档处理的应用&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;可以暂缓的场景：&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;仅做简单问答或轻量文案生成，V4 基础版已够用&lt;/li&gt;
&lt;li&gt;对推理深度要求极高、不关心成本的专业研究场景，可继续用 R1 或其后续&lt;/li&gt;
&lt;li&gt;已有稳定部署、迁移成本高的存量系统，建议等待首批稳定性观察期&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;用一张场景速查表可以快速对号入座：&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;你的核心任务&lt;/th&gt;
&lt;th&gt;推荐版本&lt;/th&gt;
&lt;th&gt;理由&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;复杂代码、多文件工程改造&lt;/td&gt;
&lt;td&gt;V4 Pro 0813&lt;/td&gt;
&lt;td&gt;代码与工程能力提升明显&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Agent / 工作流 / 自动化脚本&lt;/td&gt;
&lt;td&gt;V4 Pro 0813&lt;/td&gt;
&lt;td&gt;工具调用是相对 V4 的最大进步&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;企业客服、文档问答（高多轮一致性）&lt;/td&gt;
&lt;td&gt;V4 Pro 0813&lt;/td&gt;
&lt;td&gt;多轮一致性与长上下文更强&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;简单问答、轻量文案&lt;/td&gt;
&lt;td&gt;V4 基础版&lt;/td&gt;
&lt;td&gt;成本相同，能力已够用&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;极致深度推理、不计成本&lt;/td&gt;
&lt;td&gt;R1 系列&lt;/td&gt;
&lt;td&gt;深度思考链仍占优&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;strong&gt;一个可记忆的判断法则（Rule of Thumb）：&lt;/strong&gt; 如果任务涉及「一个模型要调用另一个工具或函数」，V4 Pro 0813 的 Agent 能力值得升级；如果任务只是「输入一段话、输出一段话」，基础版即可。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;一个 10 分钟的低门槛验证方法。&lt;/strong&gt; 不必一上来就全量迁移。用同一套真实业务输入，分别在 V4 基础版与 V4 Pro 0813 上各跑一次：一条中等难度的 LeetCode 题、一段约 500 行的工程代码、一个「需要调用两个外部函数」的 Agent 任务。分别记录首 token 耗时、答案正确率与工具调用成功率。&lt;strong&gt;判断法则：&lt;/strong&gt; 如果三组对比中至少有两项明显领先，再安排迁移；否则先观望一个发布周期，避免为无差别升级支付迁移成本。&lt;/p&gt;

&lt;h2&gt;
  
  
  五、后续展望与 FAQ
&lt;/h2&gt;

&lt;p&gt;对「要不要等下一代」这个问题，可以参考 DeepSeek 的版本节奏：它惯常以数月为周期推出大版本。V4 Pro 0813 之后，社区普遍关注三个方向：更强的多模态能力、更深的 Agent 编排，以及更细化的行业微调版本。其中，多模态与端侧部署被视为下一阶段的重点。以上均为行业观察与推测，不代表官方路线图。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;FAQ：常见问题解答&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q1：V4 Pro 0813 和 V4 基础版怎么选？&lt;/strong&gt;A：预算与任务复杂度是核心。需要 Agent 工具调用、复杂代码或高多轮一致性就选 Pro；简单对话用基础版即可。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q2：它取代 R1 吗？&lt;/strong&gt;A：在通用+推理+Agent 三合一能力上更全面，但纯深度推理的极致场景，两者可以共存，取决于你的具体评估。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q3：本地能部署吗？&lt;/strong&gt;A：可以，官方提供私有化部署包，但对硬件资源有较高要求，更适合企业而非个人单机。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q4：价格会涨吗？&lt;/strong&gt;A：官方口径为与 V4 基础版计费持平，首发未提价，后续是否调整需以官方为准。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q5：参数规模到底是多少？&lt;/strong&gt;A：官方尚未公布完整技术细节，文中数据为合理推测，最终请以技术报告为准。&lt;/p&gt;




&lt;p&gt;&lt;strong&gt;小结。&lt;/strong&gt; DeepSeek V4 Pro 0813 是一次「通用、推理、Agent」三合一的方向性迭代，核心价值在于用低成本把高级能力下沉到生产环境。它的出现，本质上把「要不要追新」这个技术选择，重新拉回到「我的场景到底需要什么」的判断上。给你的最小行动只有一个：&lt;strong&gt;挑一个真实业务场景，用上面那套 10 分钟对比法先跑一轮，再决定是否迁移&lt;/strong&gt;——这通常是风险最低的升级路径。&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>machinelearning</category>
    </item>
    <item>
      <title>Lucy 2.5 Real-Time AI Video Editing: Decart's 40ms Live Stream Revolution</title>
      <dc:creator>Khuram Youraj</dc:creator>
      <pubDate>Sat, 18 Jul 2026 13:01:38 +0000</pubDate>
      <link>https://dev.to/khuram_youraj_6c4b6780ae1/lucy-25-real-time-ai-video-editing-decarts-40ms-live-stream-revolution-1agl</link>
      <guid>https://dev.to/khuram_youraj_6c4b6780ae1/lucy-25-real-time-ai-video-editing-decarts-40ms-live-stream-revolution-1agl</guid>
      <description>&lt;h1&gt;
  
  
  Lucy 2.5 Real-Time AI Video Editing: Decart's 40ms Live Stream Revolution
&lt;/h1&gt;

&lt;p&gt;&lt;em&gt;AI video editing has finally gone real-time — from VTubing to live commerce, Lucy 2.5 is redefining how creators work with live streams&lt;/em&gt;&lt;/p&gt;




&lt;p&gt;Last week, Decart AI released Lucy 2.5, an AI model that edits video frames in real time during a live stream. We're talking sub-40ms latency at 30 FPS — by the time you finish a gesture on camera, the AI has already transformed the frame and pushed it to your audience.&lt;/p&gt;

&lt;p&gt;This isn't pre-rendered effects or post-production. Lucy 2.5 changes the "record first, edit later" workflow, compressing video editing into the gap between frames.&lt;/p&gt;

&lt;h2&gt;
  
  
  What Problem Does Lucy 2.5 Solve?
&lt;/h2&gt;

&lt;p&gt;The bottleneck in traditional AI video tools is the workflow itself. You type a prompt, wait seconds or minutes for rendering, download the result, and import it into your streaming software. If your stream needs to adapt to audience reactions in real time, this pipeline simply doesn't work.&lt;/p&gt;

&lt;p&gt;Lucy 2.5's breakthrough is turning "generation" into "transformation." Instead of creating video from scratch, it rewrites an existing video stream in real time. What the streamer sees in OBS is already the Lucy-edited version — and that's exactly what the audience gets.&lt;/p&gt;

&lt;p&gt;For three types of creators, this is a structural shift:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;VTubers / Virtual Streamers&lt;/strong&gt;: Turn a single photo into a live, streamable virtual avatar. Self-Anchoring solves the identity drift problem — leave frame and come back without the character forgetting itself&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Live Commerce&lt;/strong&gt;: Switch backgrounds and demonstrate product wear during a live explanation — no green screen, no post-processing&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ad Creative Production&lt;/strong&gt;: Generate infinite variations of a base video in real time — different languages, scenes, products&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  How 40ms Works: The DOS Inference Stack
&lt;/h2&gt;

&lt;p&gt;Lucy 2.5 runs real-time AI editing in a live streaming context through Decart's proprietary DOS inference stack. A few key design choices:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Technique&lt;/th&gt;
&lt;th&gt;What It Does&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;MXFP8 / NVFP4 Quantization&lt;/td&gt;
&lt;td&gt;Reduces inference precision to 4-bit, cutting memory bandwidth requirements&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Dynamic Sparse Attention&lt;/td&gt;
&lt;td&gt;Computes attention only for regions that change, skipping static background recomputation&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Deep Kernel Fusion&lt;/td&gt;
&lt;td&gt;Merges multiple operators into a single CUDA kernel, reducing memory read/write latency&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;These optimizations keep inference latency under 40ms at 720p — roughly 4x faster than comparable systems.&lt;/p&gt;

&lt;h3&gt;
  
  
  Self-Anchoring: Why Characters Don't Drift
&lt;/h3&gt;

&lt;p&gt;A common problem in live AI video editing is temporal drift. Over the course of a long stream, the edited character slowly degrades — eye color shifts, clothing textures blur, facial structure subtly changes.&lt;/p&gt;

&lt;p&gt;Lucy 2.5 handles this through Self-Anchoring. Every few dozen frames, the model takes a snapshot of its own output and uses it as a new reference frame. Because the anchor comes from the model's own output distribution, it doesn't diverge over time. In practice, edits remain stable for minutes at a time, even when subjects leave and re-enter the frame.&lt;/p&gt;

&lt;h2&gt;
  
  
  8 Edit Modes
&lt;/h2&gt;

&lt;p&gt;Lucy 2.5 ships with 8 editing types covering the most common live production needs:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Edit Type&lt;/th&gt;
&lt;th&gt;Typical Use Case&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Character Replacement&lt;/td&gt;
&lt;td&gt;VTuber avatar switching, brand mascot deployment&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Virtual Try-On&lt;/td&gt;
&lt;td&gt;Real-time clothing changes during live commerce&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Object Addition&lt;/td&gt;
&lt;td&gt;Insert interactive elements into product demos&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Object Replacement&lt;/td&gt;
&lt;td&gt;Swap items in the background&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Object Removal&lt;/td&gt;
&lt;td&gt;Clean up cluttered backgrounds or obstructions&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Background Replacement&lt;/td&gt;
&lt;td&gt;Change live scene in real time&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Style Transfer&lt;/td&gt;
&lt;td&gt;Full scene restyling (day to cyberpunk, etc.)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VFX Effects&lt;/td&gt;
&lt;td&gt;Fire, water, sand, and other physics-aware effects&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Each mode supports combined text prompt + reference image control. Say "change the background to a coffee shop" or provide a reference image for exact color and lighting matching.&lt;/p&gt;

&lt;h2&gt;
  
  
  Pricing and Use Cases
&lt;/h2&gt;

&lt;p&gt;Lucy 2.5 pricing is pay-as-you-go with no minimums:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Mode&lt;/th&gt;
&lt;th&gt;Price&lt;/th&gt;
&lt;th&gt;Per Hour&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Real-time 720p&lt;/td&gt;
&lt;td&gt;$0.02/sec&lt;/td&gt;
&lt;td&gt;$72/hour&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video (offline) 720p&lt;/td&gt;
&lt;td&gt;$0.04/sec&lt;/td&gt;
&lt;td&gt;$144/hour&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;At $72/hour for live editing, the ROI math works for conversion-heavy scenarios. Virtual try-on alone can reduce return rates by 40% and boost conversion by 3x.&lt;/p&gt;

&lt;p&gt;New accounts get free trial credits with no payment required. The full setup guide — from SDK integration to WebRTC streaming — is covered in the &lt;a href="https://wan27.org/blog/lucy-2-5-guide" rel="noopener noreferrer"&gt;Lucy 2.5 getting started guide&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lucy 2.5 vs Mainstream AI Video Tools
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Dimension&lt;/th&gt;
&lt;th&gt;Lucy 2.5&lt;/th&gt;
&lt;th&gt;Runway Gen-3/Gen-4&lt;/th&gt;
&lt;th&gt;Pika&lt;/th&gt;
&lt;th&gt;Sora&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Edit timing&lt;/td&gt;
&lt;td&gt;Live real-time&lt;/td&gt;
&lt;td&gt;Offline rendering&lt;/td&gt;
&lt;td&gt;Offline rendering&lt;/td&gt;
&lt;td&gt;Offline rendering&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Latency&lt;/td&gt;
&lt;td&gt;&amp;lt;40ms&lt;/td&gt;
&lt;td&gt;Seconds to minutes&lt;/td&gt;
&lt;td&gt;Seconds to minutes&lt;/td&gt;
&lt;td&gt;Minutes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Frame rate&lt;/td&gt;
&lt;td&gt;30 FPS&lt;/td&gt;
&lt;td&gt;Batch offline&lt;/td&gt;
&lt;td&gt;Batch offline&lt;/td&gt;
&lt;td&gt;Batch offline&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video length&lt;/td&gt;
&lt;td&gt;Unlimited (continuous)&lt;/td&gt;
&lt;td&gt;5-60 sec clips&lt;/td&gt;
&lt;td&gt;5-60 sec clips&lt;/td&gt;
&lt;td&gt;Limited&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Interaction&lt;/td&gt;
&lt;td&gt;Stream-and-edit&lt;/td&gt;
&lt;td&gt;Prompt-then-wait&lt;/td&gt;
&lt;td&gt;Prompt-then-wait&lt;/td&gt;
&lt;td&gt;Prompt-then-wait&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Lucy 2.5 wins in exactly one scenario: &lt;strong&gt;real-time&lt;/strong&gt;. If your business needs to modify video during an active stream — virtual avatars, background swaps, live product demos — it's the only option today. For non-real-time work, offline tools still offer superior generation quality and creative control.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;Q: What hardware does Lucy 2.5 require?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
API-only — no local GPU needed. Decart handles inference. Developers need WebRTC and SDK integration knowledge.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q: Does it work with OBS?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Yes. It integrates through WebRTC streaming without changing your existing broadcast setup.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q: Mobile support?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Yes. Decart provides Android and iOS SDKs.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Q: Can the cost come down?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
$0.02/sec adds up for long streams. But for short-duration use cases — a 5-second virtual try-on costs $0.10 — the ROI is clear for conversion-focused scenarios.&lt;/p&gt;




&lt;p&gt;Lucy 2.5 isn't a "better" AI video generation tool — it's a different kind of tool. It doesn't help you render video faster; it lets you modify video while it's already playing. The difference in application scenarios — from live shopping to VTubing to real-time ad generation — is just starting to be explored.&lt;/p&gt;

&lt;p&gt;If you're building a business that depends on real-time video content — live commerce, virtual avatar operations, interactive advertising — the &lt;a href="https://wan27.org/blog/lucy-2-5-guide" rel="noopener noreferrer"&gt;complete Lucy 2.5 guide&lt;/a&gt; can help you determine if it fits your workflow. Start with the free trial: a 30-second real-time edit costs less than a dollar.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>machinelearning</category>
      <category>video</category>
      <category>webdev</category>
    </item>
    <item>
      <title>Getting Started with Kimi K3: API Setup, Code Examples, and First Impressions</title>
      <dc:creator>Khuram Youraj</dc:creator>
      <pubDate>Fri, 17 Jul 2026 12:41:05 +0000</pubDate>
      <link>https://dev.to/khuram_youraj_6c4b6780ae1/getting-started-with-kimi-k3-api-setup-code-examples-and-first-impressions-5fl5</link>
      <guid>https://dev.to/khuram_youraj_6c4b6780ae1/getting-started-with-kimi-k3-api-setup-code-examples-and-first-impressions-5fl5</guid>
      <description>&lt;p&gt;&lt;em&gt;A practical quickstart guide for developers who want to integrate the world's largest open-source model into their projects today.&lt;/em&gt;&lt;/p&gt;




&lt;p&gt;Moonshot AI released Kimi K3 on July 16, 2026 — a 2.8-trillion-parameter open-source model with a 1M-token context window that outscores Claude Opus 4.8 on real-world benchmarks. The API is live now, and weights drop July 27.&lt;/p&gt;

&lt;p&gt;This guide gets you from zero to a working integration in under 15 minutes.&lt;/p&gt;

&lt;h2&gt;
  
  
  Prerequisites
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Python 3.10+&lt;/li&gt;
&lt;li&gt;An API key from &lt;a href="https://platform.kimi.ai" rel="noopener noreferrer"&gt;Kimi's platform&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;pip install openai&lt;/code&gt; (Kimi K3's API is OpenAI-compatible)&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Step 1: Get Your API Key
&lt;/h2&gt;

&lt;p&gt;Sign up at &lt;code&gt;platform.kimi.ai&lt;/code&gt; and generate an API key. Kimi K3 pricing is straightforward:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Cached input&lt;/strong&gt;: $0.30/MTok&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Uncached input&lt;/strong&gt;: $3.00/MTok&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Output&lt;/strong&gt;: $15.00/MTok&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;The 90% cache hit rate on coding workloads means most of your input tokens will hit the cheaper tier in practice.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 2: Basic Chat Completion
&lt;/h2&gt;

&lt;p&gt;Since Kimi K3 exposes an OpenAI-compatible endpoint, you can use the familiar &lt;code&gt;openai&lt;/code&gt; Python package:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;your-kimi-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.kimi.ai/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;system&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;You are a helpful coding assistant.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Write a Python function to parse nested JSON with error handling.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.7&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;2048&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The response quality on coding tasks is immediately noticeable. K3 scored 88.3 on Terminal-Bench 2.1 and leads all models on SWE Marathon (42.0) and Program Bench (77.8).&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 3: Using the 1M Context Window
&lt;/h2&gt;

&lt;p&gt;The 1M-token context window is K3's killer feature for real-world development. Here's how to feed an entire codebase for analysis:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;pathlib&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;Path&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;collect_source_files&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;extensions&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.py&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.ts&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.js&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)):&lt;/span&gt;
    &lt;span class="n"&gt;files_content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nc"&gt;Path&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;rglob&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;*&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;suffix&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;extensions&lt;/span&gt; &lt;span class="ow"&gt;and&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;is_file&lt;/span&gt;&lt;span class="p"&gt;():&lt;/span&gt;
            &lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read_text&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;errors&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;ignore&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
            &lt;span class="n"&gt;files_content&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;append&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;### &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;relative_to&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="s"&gt;```
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;endraw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="s"&gt;
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;raw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
```&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="se"&gt;\n\n&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;join&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;files_content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;codebase&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;collect_source_files&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;./my-project&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;system&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Analyze this codebase for security vulnerabilities and performance issues.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;codebase&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4096&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;In my testing, K3 handled a ~400-file TypeScript project (~180K tokens) without degradation in output quality. The Mooncake disaggregated inference infrastructure keeps latency reasonable even at high token counts.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 4: Multimodal Input (Vision)
&lt;/h2&gt;

&lt;p&gt;K3 has native vision capabilities — no separate model needed:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;encode_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image_path&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image_path&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;rb&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;b64encode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read&lt;/span&gt;&lt;span class="p"&gt;()).&lt;/span&gt;&lt;span class="nf"&gt;decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;image_data&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;encode_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;screenshot.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;What UI issues do you see in this screenshot? Suggest CSS fixes.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data:image/png;base64,&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;image_data&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}}&lt;/span&gt;
            &lt;span class="p"&gt;]&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;2048&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;K3 scored 81.6 on MMMU-Pro and 94.3 on MathVision, so visual understanding is genuinely strong — not a bolted-on afterthought.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 5: Streaming Responses
&lt;/h2&gt;

&lt;p&gt;For real-time applications, use streaming:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;stream&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explain the difference between KDA and standard attention in Kimi K3&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;s architecture.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;end&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;""&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;flush&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  First Impressions
&lt;/h2&gt;

&lt;p&gt;After a few days of testing, here's what stands out:&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Coding is where K3 shines brightest.&lt;/strong&gt; It consistently generates cleaner, more idiomatic code than I expected from a first release. The always-on reasoning mode means it doesn't just pattern-match — it thinks through edge cases.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;The context window is real.&lt;/strong&gt; I've been burned by models that advertise large context windows but degrade past 32K tokens. K3 maintains coherence and recall at 200K+ tokens in my tests.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Latency is acceptable, not great.&lt;/strong&gt; For a 2.8T model, response times are reasonable, but you'll notice the difference compared to smaller models. Streaming helps mask this in user-facing applications.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;One quirk:&lt;/strong&gt; K3 can be overly proactive — it sometimes adds features or refactors you didn't ask for. Specific, constrained prompts work better than open-ended instructions.&lt;/p&gt;

&lt;h2&gt;
  
  
  What's Next
&lt;/h2&gt;

&lt;p&gt;Weights drop July 27, which means self-hosted deployment is around the corner. If you're planning to run K3 on your own infrastructure, the MXFP4 quantization-aware training means you won't lose quality from post-training quantization — it's baked in from the SFT stage.&lt;/p&gt;

&lt;p&gt;For a deeper look at the architecture behind these benchmark numbers, check out &lt;a href="https://wan27.org/blog/kimi-k3-open-source" rel="noopener noreferrer"&gt;the deep dive on Hashnode&lt;/a&gt;. And for the bigger picture on what K3 means for the industry, &lt;a href="https://telegra.ph/Kimi-K3-Worlds-Largest-Open-Source-AI-Model-Released-by-Moonshot-AI-07-17" rel="noopener noreferrer"&gt;the news brief on Telegraph&lt;/a&gt; has the quick summary.&lt;/p&gt;

&lt;p&gt;For the full technical breakdown, benchmark tables, and deployment guidance, see our &lt;a href="https://wan27.org/blog/kimi-k3-open-source" rel="noopener noreferrer"&gt;comprehensive Kimi K3 open-source guide&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Happy building.&lt;/p&gt;

</description>
      <category>opensource</category>
      <category>ai</category>
      <category>python</category>
      <category>machinelearning</category>
    </item>
    <item>
      <title>Getting Started with Kimi K3: API Setup, Code Examples, and First Impressions</title>
      <dc:creator>Khuram Youraj</dc:creator>
      <pubDate>Fri, 17 Jul 2026 11:43:38 +0000</pubDate>
      <link>https://dev.to/khuram_youraj_6c4b6780ae1/getting-started-with-kimi-k3-api-setup-code-examples-and-first-impressions-16cd</link>
      <guid>https://dev.to/khuram_youraj_6c4b6780ae1/getting-started-with-kimi-k3-api-setup-code-examples-and-first-impressions-16cd</guid>
      <description>&lt;h2&gt;
  
  
  &lt;em&gt;A practical quickstart guide for developers who want to integrate the world's largest open-source model into their projects today.&lt;/em&gt;
&lt;/h2&gt;

&lt;p&gt;Moonshot AI released Kimi K3 on July 16, 2026 — a 2.8-trillion-parameter open-source model with a 1M-token context window that outscores Claude Opus 4.8 on real-world benchmarks. The API is live now, and weights drop July 27.&lt;/p&gt;

&lt;p&gt;This guide gets you from zero to a working integration in under 15 minutes.&lt;/p&gt;

&lt;h2&gt;
  
  
  Prerequisites
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Python 3.10+&lt;/li&gt;
&lt;li&gt;An API key from &lt;a href="https://platform.kimi.ai" rel="noopener noreferrer"&gt;Kimi's platform&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;pip install openai&lt;/code&gt; (Kimi K3's API is OpenAI-compatible)&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Step 1: Get Your API Key
&lt;/h2&gt;

&lt;p&gt;Sign up at &lt;code&gt;platform.kimi.ai&lt;/code&gt; and generate an API key. Kimi K3 pricing is straightforward:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Cached input&lt;/strong&gt;: $0.30/MTok&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Uncached input&lt;/strong&gt;: $3.00/MTok&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Output&lt;/strong&gt;: $15.00/MTok&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;The 90% cache hit rate on coding workloads means most of your input tokens will hit the cheaper tier in practice.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 2: Basic Chat Completion
&lt;/h2&gt;

&lt;p&gt;Since Kimi K3 exposes an OpenAI-compatible endpoint, you can use the familiar &lt;code&gt;openai&lt;/code&gt; Python package:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;your-kimi-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://api.kimi.ai/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;system&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;You are a helpful coding assistant.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Write a Python function to parse nested JSON with error handling.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.7&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;2048&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The response quality on coding tasks is immediately noticeable. K3 scored 88.3 on Terminal-Bench 2.1 and leads all models on SWE Marathon (42.0) and Program Bench (77.8).&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 3: Using the 1M Context Window
&lt;/h2&gt;

&lt;p&gt;The 1M-token context window is K3's killer feature for real-world development. Here's how to feed an entire codebase for analysis:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;pathlib&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;Path&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;collect_source_files&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;extensions&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.py&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.ts&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;.js&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)):&lt;/span&gt;
    &lt;span class="n"&gt;files_content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nc"&gt;Path&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;rglob&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;*&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;suffix&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;extensions&lt;/span&gt; &lt;span class="ow"&gt;and&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;is_file&lt;/span&gt;&lt;span class="p"&gt;():&lt;/span&gt;
            &lt;span class="n"&gt;content&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read_text&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;errors&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;ignore&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
            &lt;span class="n"&gt;files_content&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;append&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;### &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;path&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;relative_to&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;directory&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="s"&gt;```
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;endraw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n&lt;/span&gt;&lt;span class="s"&gt;
&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="n"&gt;raw&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;
```&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="se"&gt;\n\n&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;join&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;files_content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;codebase&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;collect_source_files&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;./my-project&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;system&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Analyze this codebase for security vulnerabilities and performance issues.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;codebase&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4096&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;In my testing, K3 handled a ~400-file TypeScript project (~180K tokens) without degradation in output quality. The Mooncake disaggregated inference infrastructure keeps latency reasonable even at high token counts.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 4: Multimodal Input (Vision)
&lt;/h2&gt;

&lt;p&gt;K3 has native vision capabilities — no separate model needed:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;encode_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image_path&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;image_path&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;rb&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;base64&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;b64encode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read&lt;/span&gt;&lt;span class="p"&gt;()).&lt;/span&gt;&lt;span class="nf"&gt;decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;image_data&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;encode_image&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;screenshot.png&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;What UI issues do you see in this screenshot? Suggest CSS fixes.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;image_url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;url&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data:image/png;base64,&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;image_data&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}}&lt;/span&gt;
            &lt;span class="p"&gt;]&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;2048&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;K3 scored 81.6 on MMMU-Pro and 94.3 on MathVision, so visual understanding is genuinely strong — not a bolted-on afterthought.&lt;/p&gt;

&lt;h2&gt;
  
  
  Step 5: Streaming Responses
&lt;/h2&gt;

&lt;p&gt;For real-time applications, use streaming:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;stream&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explain the difference between KDA and standard attention in Kimi K3&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;s architecture.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;end&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;""&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;flush&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  First Impressions
&lt;/h2&gt;

&lt;p&gt;After a few days of testing, here's what stands out:&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Coding is where K3 shines brightest.&lt;/strong&gt; It consistently generates cleaner, more idiomatic code than I expected from a first release. The always-on reasoning mode means it doesn't just pattern-match — it thinks through edge cases.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;The context window is real.&lt;/strong&gt; I've been burned by models that advertise large context windows but degrade past 32K tokens. K3 maintains coherence and recall at 200K+ tokens in my tests.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Latency is acceptable, not great.&lt;/strong&gt; For a 2.8T model, response times are reasonable, but you'll notice the difference compared to smaller models. Streaming helps mask this in user-facing applications.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;One quirk:&lt;/strong&gt; K3 can be overly proactive — it sometimes adds features or refactors you didn't ask for. Specific, constrained prompts work better than open-ended instructions.&lt;/p&gt;

&lt;h2&gt;
  
  
  What's Next
&lt;/h2&gt;

&lt;p&gt;Weights drop July 27, which means self-hosted deployment is around the corner. If you're planning to run K3 on your own infrastructure, the MXFP4 quantization-aware training means you won't lose quality from post-training quantization — it's baked in from the SFT stage.&lt;/p&gt;

&lt;p&gt;For a deeper look at the API's advanced features and parameter tuning, check out &lt;a href="https://wan27.org/blog/kimi-k3-open-source" rel="noopener noreferrer"&gt;the API reference guide on Qiita&lt;/a&gt;. And for the bigger picture on what K3 means for the industry, &lt;a href="https://wan27.org/blog/kimi-k3-open-source" rel="noopener noreferrer"&gt;our analysis on Medium&lt;/a&gt; covers the competitive dynamics.&lt;/p&gt;

&lt;p&gt;For the full technical breakdown, benchmark tables, and deployment guidance, see our &lt;a href="https://wan27.org/blog/kimi-k3-open-source" rel="noopener noreferrer"&gt;comprehensive Kimi K3 open-source guide&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Happy building.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>tutorial</category>
    </item>
  </channel>
</rss>
