Token Ledger Digest – 2026-09-03
Most cost‑impacting change
- Qwen: Qwen3.5 397B A17B – completion price rose from $2.34 to $3.50 per M tokens (+$1.16/M); prompt price rose from $0.39 to $0.55 per M tokens (+$0.16/M). Who should care: Teams running large‑scale completion workloads (e.g., chatbots, code generation) will see ~49% higher completion costs.
Added models
- Meta: Muse Spark 1.3 Contributor – prompt $0.10/M, completion $0.20/M.
- Meta: Muse Spark 1.3 – prompt $1.25/M, completion $4.25/M.
- Google: Gemini 3.8 Flash – prompt $0.75/M, completion $3.75/M.
- Google: Gemini 3.8 Flash (batch) – prompt $0.38/M, completion $1.88/M. Who should care: Users needing 1M‑token context models; batch variant offers ~50% lower prompt cost.
Removed model
- NVIDIA: Nemotron 3 Ultra (batch) – prompt $0.60/M, completion $3.60/M (no longer available). Who should care: Migrate batch jobs to alternatives (e.g., Gemini 3.8 Flash batch) to avoid service interruption.
Price changes (old → new, per M tokens)
- Z.ai: GLM Latest – prompt $1.15 → $1.12 (−$0.03), completion $3.50 → $3.52 (+$0.02).
- Google: Gemini 3.7 Flash (batch) – prompt $0.19 → $0.38 (+$0.19), completion $0.94 → $1.88 (+$0.94).
- Meta: Muse Glimmer 30B – completion $1.20 → $1.10 (−$0.10); prompt unchanged $0.30.
- NVIDIA: Nemotron 3 Ultra – prompt $0.63 → $0.60 (−$0.03), completion $3.13 → $2.40 (−$0.73).
- Z.ai: GLM 4.6 – prompt $0.43 → $0.55 (+$0.12), completion $1.75 → $2.20 (+$0.45).
- DeepSeek: DeepSeek V3 – prompt $0.26 → $0.32 (+$0.06), completion $1.03 → $0.89 (−$0.14).
- Meta: Llama 3.3 70B Instruct – prompt $0.71 → $0.10 (−$0.61), completion $0.71 → $0.32 (−$0.39).
Cheapest models today (per M tokens)
- IBM: Granite 4.0 Micro – prompt $0.02, completion $0.11
- Mistral: Mistral Nemo – prompt $0.02, completion $0.03
- Ling-3.0-flash – prompt $0.02, completion $0.06
Total models tracked: 424.
Originally published at The Token Ledger. Subscribe for the daily digest.
Top comments (0)