<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: AGIRouter</title>
    <description>The latest articles on DEV Community by AGIRouter (@agirouter).</description>
    <link>https://dev.to/agirouter</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4156212%2F1399d3f9-1d10-4c4a-9655-e1c81dc3d069.png</url>
      <title>DEV Community: AGIRouter</title>
      <link>https://dev.to/agirouter</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/agirouter"/>
    <language>en</language>
    <item>
      <title>How I cut LLM batch costs with time-of-use scheduling</title>
      <dc:creator>AGIRouter</dc:creator>
      <pubDate>Fri, 02 Oct 2026 05:19:49 +0000</pubDate>
      <link>https://dev.to/agirouter/how-i-cut-llm-batch-costs-with-time-of-use-scheduling-1h41</link>
      <guid>https://dev.to/agirouter/how-i-cut-llm-batch-costs-with-time-of-use-scheduling-1h41</guid>
      <description>&lt;p&gt;Every batch job I run against LLM APIs used to cost the same at 2 a.m. as at 2 p.m. Then I started routing workloads through a unified gateway that charges different rates at different hours, and my overnight evaluation runs dropped to half the token cost — without touching a single prompt. This post shows the scheduling pattern, the math, and the pitfalls, so you can decide whether it fits your stack.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Disclosure:&lt;/strong&gt; I'm a founder of AGIRouter, the gateway behind the numbers below. Every pricing figure is an example taken from the platform's public pricing API (agirouter.org/api/pricing) and may change — check the official pricing page before relying on any number. This article was drafted with AI assistance and reviewed and fact-checked by me before publishing.&lt;/p&gt;

&lt;h2&gt;
  
  
  What time-of-use pricing actually means here
&lt;/h2&gt;

&lt;p&gt;AGIRouter is a multi-model AI gateway built on the open-source New-API project: one API key reaches 29 models across the DeepSeek, Kimi, GLM, Ant Group Ling, GPT-5.5/5.6/6, and Gemini-3 families through a single OpenAI-compatible endpoint (it also speaks the Anthropic, Gemini, and image-generation protocols), imports into Cherry Studio or Lobe Chat with one click, and bills in USD via Stripe.&lt;/p&gt;

&lt;p&gt;Some models on the platform use tiered, time-of-use billing (the &lt;code&gt;billing_expr&lt;/code&gt; field in the pricing API). For the DeepSeek v4 series, the day splits into two tiers in Asia/Shanghai time:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Off-peak (谷价):&lt;/strong&gt; 00:00–01:00, 04:00–06:00, and 10:00–24:00 — 17 hours a day&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Peak (峰价):&lt;/strong&gt; 01:00–04:00 and 06:00–10:00 — 7 hours a day&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;The off-peak tier is exactly 50% of the peak tier for the DeepSeek models I checked. To be clear: this is AGIRouter's platform pricing strategy, not an official price cut from the model vendors.&lt;/p&gt;

&lt;h2&gt;
  
  
  Why batch jobs are the perfect candidate
&lt;/h2&gt;

&lt;p&gt;Interactive traffic needs the answer now, so it pays peak rates. Batch work — evaluation sets, embedding generation, migration scripts, bulk summarization, dataset labeling — is delay-tolerant. If a job can wait a few hours, it can wait for the off-peak window. That's the entire idea: separate &lt;em&gt;when&lt;/em&gt; a job runs from &lt;em&gt;what&lt;/em&gt; the job does.&lt;/p&gt;

&lt;h2&gt;
  
  
  The scheduler (Python)
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;datetime&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;datetime&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;zoneinfo&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;ZoneInfo&lt;/span&gt;

&lt;span class="n"&gt;SHANGHAI&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;ZoneInfo&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Asia/Shanghai&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;in_off_peak&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;now&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;None&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="sh"&gt;"""&lt;/span&gt;&lt;span class="s"&gt;AGIRouter off-peak (谷价) windows, Asia/Shanghai: 00-01, 04-06, 10-24.&lt;/span&gt;&lt;span class="sh"&gt;"""&lt;/span&gt;
    &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;now&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="n"&gt;datetime&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;now&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;SHANGHAI&lt;/span&gt;&lt;span class="p"&gt;)).&lt;/span&gt;&lt;span class="n"&gt;hour&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;=&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;&lt;/span&gt; &lt;span class="mi"&gt;6&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;=&lt;/span&gt; &lt;span class="mi"&gt;10&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;seconds_until_off_peak&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;now&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;None&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="sh"&gt;"""&lt;/span&gt;&lt;span class="s"&gt;Seconds until the next off-peak window opens (0 if already off-peak).&lt;/span&gt;&lt;span class="sh"&gt;"""&lt;/span&gt;
    &lt;span class="n"&gt;now&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;now&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="n"&gt;datetime&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;now&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;SHANGHAI&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;now&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;hour&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;=&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;&lt;/span&gt; &lt;span class="mi"&gt;6&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;=&lt;/span&gt; &lt;span class="mi"&gt;10&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;
    &lt;span class="n"&gt;target&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;h&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt; &lt;span class="k"&gt;else&lt;/span&gt; &lt;span class="mi"&gt;10&lt;/span&gt;
    &lt;span class="n"&gt;nxt&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;now&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;replace&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;hour&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;target&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;minute&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;second&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;microsecond&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="nf"&gt;return &lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;nxt&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="n"&gt;now&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;total_seconds&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;run_batch&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;prompts&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;deepseek-v4-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="n"&gt;wait&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;seconds_until_off_peak&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;wait&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Peak window: sleeping &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;wait&lt;/span&gt;&lt;span class="o"&gt;/&lt;/span&gt;&lt;span class="mi"&gt;3600&lt;/span&gt;&lt;span class="si"&gt;:&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;h before &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;prompts&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt; job(s)&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;sleep&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;wait&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
    &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
        &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;p&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;p&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;prompts&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Two production notes. First, &lt;code&gt;time.sleep&lt;/code&gt; is fine for scripts, but for real queues use Celery beat, cron, or a cloud scheduler with retries and idempotency keys. Second, test the timezone logic hard: Asia/Shanghai is UTC+8 with no DST, but your servers probably run UTC, and an off-by-eight-hours bug silently converts savings into peak-rate bills.&lt;/p&gt;

&lt;h2&gt;
  
  
  What the numbers look like
&lt;/h2&gt;

&lt;p&gt;The table below uses the pricing multipliers published in the API for &lt;code&gt;deepseek-v4-flash&lt;/code&gt; (p = input token price, c = output token price, cr = cache-hit price). These are relative price units, not currency — the platform converts them into actual charges — so treat the table as an example and check the pricing page for current figures.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Workload (1M input + 500k output tokens)&lt;/th&gt;
&lt;th&gt;Peak&lt;/th&gt;
&lt;th&gt;Off-peak&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Fresh input only&lt;/td&gt;
&lt;td&gt;900,000&lt;/td&gt;
&lt;td&gt;450,000&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;80% of input served from cache&lt;/td&gt;
&lt;td&gt;664,800&lt;/td&gt;
&lt;td&gt;332,400&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Same job, same model, same output quality — the off-peak run costs half. The pro tier behaves identically in relative terms: &lt;code&gt;deepseek-v4-pro&lt;/code&gt; is priced at p×1.32 / c×3.96 at peak and p×0.66 / c×1.98 off-peak, so the same 1M+500k run falls from 3,300,000 to 1,650,000 units.&lt;/p&gt;

&lt;h2&gt;
  
  
  Cache hits: the quiet multiplier
&lt;/h2&gt;

&lt;p&gt;The pricing API also prices cache hits (&lt;code&gt;cr&lt;/code&gt;) at roughly 2% of fresh input — 0.003 versus 0.15 units off-peak for v4-flash. Stack the two effects and a cached token processed off-peak costs about 1% of a fresh token processed at peak (0.003 versus 0.30 units). In practice, raising your cache-hit rate means keeping system prompts and document prefixes stable across a batch, grouping similar documents together, and not rewriting prompts mid-run. How much caching a model actually grants depends on the provider and model — the pricing page lists a cache ratio per model where applicable.&lt;/p&gt;

&lt;h2&gt;
  
  
  Limitations worth knowing
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Not every model is tiered.&lt;/strong&gt; In the current pricing API, GLM and Ling models use flat per-tier pricing; only some models (like the DeepSeek v4 series) split by hour. Check each model's billing mode before planning around off-peak windows.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Peak hours still matter.&lt;/strong&gt; Latency-sensitive traffic can't wait; the savings apply only to the slice of work that can.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;A sleeping job is a delayed job.&lt;/strong&gt; Add monitoring, retries, and alerting — a batch that silently never runs is worse than an expensive one.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Prices and rosters change.&lt;/strong&gt; The model list and multipliers are versioned in the API (&lt;code&gt;pricing_version&lt;/code&gt;); re-verify every billing cycle.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Free tiers exist too.&lt;/strong&gt; Ling-3.1-flash is currently marked free on the platform, which can beat both tiers for suitable workloads.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Bottom line
&lt;/h2&gt;

&lt;p&gt;If your LLM spend includes delay-tolerant batch work, the optimization is low-effort: keep your code identical, move execution into the off-peak window, and keep prompts cache-friendly. At the rates currently published, that pattern cuts DeepSeek batch token costs by half on the gateway I run — but exact numbers are time- and model-specific, so verify against the pricing page before you budget around them.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;CTA:&lt;/strong&gt; Model roster and live pricing: &lt;a href="https://agirouter.org/api/pricing" rel="noopener noreferrer"&gt;https://agirouter.org/api/pricing&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;&lt;em&gt;Disclosure: I'm a founder of AGIRouter. Pricing examples above come from the platform's public pricing API (verified 2026-10-02) and are subject to change; always confirm current rates at agirouter.org/api/pricing. This post was written with AI assistance and fact-checked by the author.&lt;/em&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>python</category>
      <category>devtools</category>
    </item>
    <item>
      <title>Hello everyone</title>
      <dc:creator>AGIRouter</dc:creator>
      <pubDate>Fri, 02 Oct 2026 05:17:00 +0000</pubDate>
      <link>https://dev.to/agirouter/hello-everyone-4f5f</link>
      <guid>https://dev.to/agirouter/hello-everyone-4f5f</guid>
      <description></description>
    </item>
  </channel>
</rss>
