Originally published on NextFuture
OpenAI phát hành GPT-6 Astra ngày 3/9/2026 với giá $10 / 1M token input và $50 / 1M output — đúng bằng giá Claude Fable 5.1 ra mắt trước đó hai ngày.
Với dev VN trả tiền API bằng USD, giá bằng nhau nghĩa là quyết định chọn model chuyển xuống ba chỗ ít ai đọc: giá cache, tốc độ output, và ai đo benchmark.
Giá niêm yết giống nhau, hoá đơn thì không
Cùng $10/$50, nhưng phần cache lệch hẳn. Theo bảng so sánh của các bài phân tích launch week, Fable 5.1 tính cache read $0.25/1M còn Astra tính $1.00/1M — chênh 4 lần. Nếu pipeline của bạn nhồi lại một system prompt dài, một bộ tài liệu, hoặc chạy hội thoại nhiều lượt, đây là dòng chi phí lớn nhất chứ không phải giá input.
Cửa dưới còn rẻ hơn nhiều. Gemini 3.8 Flash niêm yết $0.75/$3.75 theo giá khuyến mãi đến 31/12/2026, sau đó Google liệt kê $1.50/$7.50. Astra còn có một fast tier ở mức $20/$100.
ModelInput /1MOutput /1MCache readContextTốc độ output
GPT-6 Astra$10.00$50.00$1.001.050.000 token~87 tok/s
Claude Fable 5.1$10.00$50.00$0.251.000.000 token~67–69 tok/s
Gemini 3.8 Flash$0.75 (promo)$3.75 (promo)—~1M token~305 tok/s
Tốc độ output là throughput do Artificial Analysis đo, không phải con số vendor công bố. Max output của Astra và Fable 5.1 đều là 128.000 token.
Ba bảng xếp hạng, ba thứ tự khác nhau
Bảng của OpenAI cho Astra thắng gần như mọi dòng: FrontierMath Tier 4 97,6% so với 87,8% của Fable 5.1, ARC-AGI-3 99,9%, GPQA Diamond 96,0%, OSWorld 2.0 72,6%.
Artificial Analysis đo độc lập thì ra thứ tự ngược: Intelligence Index Fable 5.1 66 điểm, Astra 61, Gemini 3.8 Flash 59; Coding Agent Index lần lượt ~70, ~67 và ~61. LLM Stats cân trọng số khác nữa và xếp Astra trên, 60,7 so với 56,8.
Dòng gần với công việc dev nhất — Terminal-Bench 4.0 — gần như hoà: 57,7% so với 55,8%. Trên Humanity's Last Exam có tool, Fable 5.1 đạt 65,0% còn Astra 57,2%. Trên DeepSWE v1.1, Astra 74,1% chỉ nhỉnh hơn Gemini 3.8 Flash 73,8%.
Đọc chú thích trước khi tin bảng benchmark
Bài phân tích so sánh dẫn lại phần footnote của Vellum và nêu rõ: OpenAI tài trợ việc phát triển FrontierMath và có quyền truy cập độc quyền một phần bộ đề; điểm ARC-AGI-3 chạy trên adapter harness của chính OpenAI; phần so sánh BenchCAD với Claude dùng cấu hình đánh giá đã chỉnh sửa; còn ExploitGym thì chạy sau khi bỏ giới hạn thời gian.
Quan trọng hơn cho người viết code: bài này khẳng định bản production mà bạn gọi được qua API là bản đã hardened về an toàn, và nó từ chối đúng loại tác vụ cyber mà điểm ExploitBench 100% được đo trên đó. Điểm số bạn đọc và model bạn gọi không phải một thứ.
Chọn thế nào cho stack của bạn
Đây là phân tích, không phải khuyến nghị của nguồn. Workload lặp lại context nhiều thì khoảng cách cache 4 lần tự quyết định thay bạn. Chạy volume lớn và chấp nhận trần chất lượng thấp hơn thì giá Gemini 3.8 Flash lệch hẳn một bậc. Còn nếu tác vụ chính là toán hay computer-use, bảng của OpenAI nghiêng về Astra — nhưng không aggregate nào cân đúng traffic của bạn.
Cách rẻ nhất để quyết định: lấy 50–100 request thật trong log của bạn, chạy qua cả ba, tính chi phí trên hoá đơn thật thay vì trên bảng giá.
Việc cần làm tuần này
Đo tỉ lệ cached input trong traffic hiện tại — nó quyết định khoảng cách $0.25 và $1.00 có chạm tới bạn không.
Ghi hạn 31/12/2026 của giá promo Gemini 3.8 Flash vào kế hoạch ngân sách; đừng dự toán dài hạn trên mức $0.75/$3.75.
Đưa Terminal-Bench và Coding Agent Index lên trước FrontierMath khi đọc bảng mới — chúng gần việc thật của bạn hơn.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)