Để gọi API GPT-6.1 Sol, gửi yêu cầu POST đến https://api.openai.com/v1/responses với "model": "gpt-6.1-sol" và API key dưới dạng Bearer token. Giá niêm yết giữ nguyên ở mức 2 đô la đầu vào và 10 đô la đầu ra cho mỗi triệu token như GPT-6 Sol, nhưng đầu vào đã cache giảm từ 0,20 đô la xuống 0,10 đô la. Khi di chuyển từ gpt-6-sol, thay đổi chính là model ID và mức reasoning.effort: GPT-6.1 Sol không hỗ trợ none hoặc minimal, vì vậy cần ánh xạ các yêu cầu này sang low.
OpenAI phát hành GPT-6.1 Sol tại DevDay ngày 29 tháng 9 năm 2026. Xem tổng hợp DevDay 2026 và bài viết GPT-6.1 Sol là gì để biết thêm bối cảnh và điểm chuẩn. Bài viết này tập trung vào yêu cầu đầu tiên, cách chọn effort, các thay đổi di chuyển, giá Batch/Flex/Fast và cách kiểm thử hồi quy hai model ID bằng Apidog.
GPT-6 Sol so với GPT-6.1 Sol: những thay đổi trong API
Phần lớn thông số giữ nguyên. Dưới đây là các khác biệt cần kiểm tra dựa trên trang model GPT-6.1 Sol, trang GPT-6 Sol và hướng dẫn di chuyển GPT-6 của OpenAI.
| Hạng mục | gpt-6-sol |
gpt-6.1-sol |
Việc cần làm |
|---|---|---|---|
| Đầu vào / đầu ra mỗi 1M token, Standard | $2 / $10 | $2 / $10 | Không cần thay đổi |
| Đầu vào đã cache mỗi 1M token | $0.20 | $0.10 | Tính lại chi phí cache |
| Ghi cache mỗi 1M token | $2.50 | $2.50 | Không cần thay đổi |
| Context window / đầu vào tối đa / đầu ra tối đa | 1,050,000 / 922,000 / 128,000 | 1,050,000 / 922,000 / 128,000 | Không cần thay đổi |
| Thời điểm cắt dữ liệu | 20 tháng 4, 2026 | 30 tháng 4, 2026 | Chạy lại các eval nhạy cảm về ngày |
reasoning.effort |
none, low, medium, high, xhigh, max
|
low, medium, high, xhigh, max
|
Ánh xạ none sang low và đánh giá lại |
| Gọi hàm qua Chat Completions | Chỉ với reasoning_effort: "none"
|
Không hỗ trợ | Chuyển tool call sang Responses API |
| Endpoint | Chat Completions, Responses, Batch | Giống nhau | Không cần thay đổi |
| Rate limit | Tier 1: 500 RPM / 500K TPM; Tier 5: 15,000 RPM / 40M TPM | Giống nhau | Không cần thay đổi |
Trang GPT-6 Sol hiện chuyển hướng người đọc đến GPT-6.1 Sol như “mô hình Sol mới hơn”.
Gửi yêu cầu GPT-6.1 Sol đầu tiên
Đặt API key vào biến môi trường:
export OPENAI_API_KEY="your_api_key"
Gọi Responses API:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
Ví dụ Python:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Khi xử lý phản hồi, kiểm tra các trường sau:
-
statusphải làcompleted. Nếu hết ngân sách đầu ra, API có thể trả vềincompletevớiincomplete_details.reason: "max_output_tokens". Hướng dẫn reasoning đề xuất dành ít nhất 25.000 token cho reasoning và output trong giai đoạn thử nghiệm. -
outputlà một mảng. Tìm item cótype: "message"và đọcoutput_texttừ nội dung của item đó; không nên phụ thuộc vào vị trí mảng. -
usage.output_tokensbao gồm reasoning token và được tính theo giá output token. Xem số reasoning token tạiusage.output_tokens_details.reasoning_tokens. -
usage.input_tokens_detailschứacached_tokensvàcache_write_tokens, dùng để theo dõi lợi ích từ giá cache mới.
Dùng Responses API cho mọi luồng có công cụ. GPT-6.1 Sol chỉ hỗ trợ Chat Completions cho yêu cầu không dùng công cụ. Xem thêm hướng dẫn OpenAI Responses API.
Chọn mức độ nỗ lực lập luận
medium là mặc định nếu bạn không truyền reasoning.effort. Đây cũng là biến số quan trọng nhất ảnh hưởng đến chi phí, độ trễ và chất lượng.
| Effort | Nên bắt đầu với | OpenAI báo cáo về GPT-6.1 Sol |
|---|---|---|
low |
Chat, trích xuất, phân loại, workload trước đây dùng none
|
Trên các cuộc hội thoại bị người dùng gắn cờ, tỷ lệ phản hồi có lỗi thực tế giảm từ 11.4% xuống 7.7% |
medium |
Agent automation và quy trình có tool call | AutomationBench 1.0.6: cao hơn Claude Opus 5.5 2.2 điểm phần trăm với chi phí khoảng một phần ba; cao hơn GPT-6 Sol 4.8 điểm phần trăm ở cùng cấu hình |
high |
Gỡ lỗi khó, lập kế hoạch sâu | Không có tuyên bố cụ thể theo effort |
xhigh |
Đầu ra hoàn thiện, tác vụ dài không đồng bộ | Không có tuyên bố cụ thể theo effort |
max |
Computer use và tác vụ khoa học khó | OSWorld 2.0: cao hơn GPT-6 Sol 7 điểm phần trăm ở mức tối đa với chi phí chưa đến một nửa |
Hướng dẫn chọn model của OpenAI gợi ý medium cho công việc kỹ thuật phức tạp và xhigh cho đầu ra hoàn thiện hoặc quyết định dựa trên bằng chứng mâu thuẫn. Bài đăng ra mắt GPT-6.1 Sol cung cấp thêm các kết quả benchmark.
Lưu ý:
- Bộ dữ liệu đánh giá tính xác thực gồm các cuộc hội thoại từng bị gắn cờ lỗi, không phải lưu lượng truy cập thông thường.
- Trên Terminal-Bench Science, GPT-6 Astra vẫn đạt điểm cao nhất là 68.1%, nên OpenAI khuyến nghị Astra cho các công việc khoa học khó nhất.
Nếu workload cũ cần độ trễ thấp và dùng none, hãy bắt đầu với low, sau đó đo chất lượng, latency và chi phí trên tập dữ liệu đại diện. Nếu cần thay đổi effort trong cuộc hội thoại mà không làm mất prompt cache, thêm configuration_update thay vì đổi reasoning.effort ở cấp request.
Di chuyển từ gpt-6-sol: bốn thay đổi mã
1. Thay model ID
Đặt model ID trong biến môi trường hoặc cấu hình để dễ rollback:
export OPENAI_MODEL_ID="gpt-6.1-sol"
response = client.responses.create(
model=os.environ["OPENAI_MODEL_ID"],
reasoning={"effort": "medium"},
input="...",
)
2. Ánh xạ none và minimal sang low
GPT-6.1 Sol không hỗ trợ none hoặc minimal.
function normalizeEffort(effort) {
if (effort === "none" || effort === "minimal") {
return "low";
}
return effort || "medium";
}
Bắt đầu các workload từng dùng minimal tại low, rồi chạy eval trên prompt thực tế. Trên GPT-6 Astra, gửi none trả về HTTP 400, vì vậy nên sửa mapping này trước khi chuyển traffic.
3. Loại bỏ sampling parameters
Khi effort không phải none, loại bỏ:
temperaturetop_ptop_logprobs-
logprobstrong Chat Completions
Ví dụ payload nên chuyển từ:
{
"model": "gpt-6-sol",
"reasoning_effort": "none",
"temperature": 0,
"top_p": 1,
"input": "..."
}
Sang:
{
"model": "gpt-6.1-sol",
"reasoning": {
"effort": "low"
},
"input": "..."
}
4. Chuyển tool call từ Chat Completions sang Responses
GPT-6 Sol chỉ cho phép function calling trong Chat Completions khi dùng reasoning_effort: "none". GPT-6.1 Sol không có tổ hợp tương đương, vì vậy hãy dùng Responses API cho luồng có tool.
Sau khi thay model, chạy lại mọi test phụ thuộc vào tính thời sự vì thời điểm cắt dữ liệu thay đổi từ ngày 20 sang ngày 30 tháng 4 năm 2026. Nếu đang chuyển từ Astra sang Sol, xem hướng dẫn di chuyển GPT-6 Astra sang Sol.
Giá Batch, Flex, Fast và đầu vào đã cache
Giá mỗi 1 triệu token, theo trang giá API:
| Tầng | Đầu vào | Đầu vào đã cache | Ghi cache | Đầu ra |
|---|---|---|---|---|
| Standard | $2.00 | $0.10 | $2.50 | $10.00 |
| Batch | $1.00 | $0.05 | $1.25 | $5.00 |
| Flex | $1.00 | $0.05 | $1.25 | $5.00 |
| Fast | $4.00 | $0.20 | $5.00 | $20.00 |
| Standard, prompt trên 272K input token | $4.00 | $0.20 | $5.00 | $15.00 |
Trang model GPT-6.1 Sol lưu ý rằng prompt vượt 272K input token sẽ bị tính giá gấp 2 lần cho input/cache và gấp 1.5 lần cho output trên toàn bộ request.
Chọn service tier theo workload:
{
"model": "gpt-6.1-sol",
"service_tier": "flex",
"input": "..."
}
{
"model": "gpt-6.1-sol",
"service_tier": "fast",
"input": "..."
}
"priority" cũng được chấp nhận như bí danh của fast. Fast không khả dụng với nơi cư trú dữ liệu EU. Ultrafast cho GPT-6.1 Sol “sắp ra mắt”; hiện khả dụng rộng rãi cho GPT-6 Astra. Xem chế độ OpenAI Ultrafast. Với tác vụ chạy qua đêm, dùng OpenAI Batch API.
Ước tính tiết kiệm từ prompt cache
Theo hướng dẫn prompt caching:
- Cache read trên GPT-6.1 Sol có giá bằng
0.05xgiá input. - Cache read trên GPT-6 Sol có giá bằng
0.1xgiá input. - Cache write có giá bằng
1.25xgiá input trên cả hai model. - Tiền tố cache tối thiểu là 1.024 token hiển thị.
- Prefix đã cache đủ điều kiện ít nhất 30 phút sau lần ghi hoặc tái sử dụng cuối cùng.
Ví dụ với system prompt 50.000 token được tái sử dụng cho 1.000 request:
- Một lần cache write:
$0.125trên cả hai model. - 999 lần cache read trên GPT-6 Sol:
$9.99. - 999 lần cache read trên GPT-6.1 Sol:
$5.00.
Xem thêm chiến lược chia prompt tại bộ nhớ đệm lời nhắc GPT-6.
Kiểm tra việc hoán đổi trong Apidog
Không nên chuyển production chỉ dựa trên giá niêm yết. Hãy gửi cùng một request đến cả hai model ID, sau đó so sánh output, token usage và chi phí trong Apidog.
-
Tạo environment gồm:
-
OPENAI_API_KEY: lưu dưới dạng secret. -
MODEL_ID: ban đầu làgpt-6-sol. -
EFFORT: ban đầu làmedium.
-
Tạo request:
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
Body:
{
"model": "{{MODEL_ID}}",
"reasoning": {
"effort": "{{EFFORT}}"
},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Thêm assertions:
- HTTP status là
200. -
$.statusbằngcompleted. -
$.output[*].typechứamessage. -
$.usage.output_tokenslớn hơn0. -
$.usage.output_tokens_details.reasoning_tokenstồn tại. - Output là JSON hợp lệ và có các key mà ứng dụng của bạn cần, ví dụ
riskvàfix.
- Thêm post-response script để tính chi phí ước tính:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = (
(u.input_tokens - cached - writes) * 2 +
cached * cachedRate +
writes * 2.5 +
u.output_tokens * 10
) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Chạy request với
MODEL_ID=gpt-6-sol, sau đó đổi sanggpt-6.1-solvà chạy lại. So sánh:
reasoning_tokensoutput_tokens- Nội dung output
- Chi phí ước tính
- Tỷ lệ assertion pass
Nếu đang di chuyển từ none, chạy baseline với gpt-6-sol + none, rồi chạy candidate với gpt-6.1-sol + low.
Đưa request và một tập prompt thực tế vào scenario test, sau đó chạy hai model trong CI bằng Apidog CLI:
npm install -g apidog-cli
apidog run \
--access-token "$APIDOG_ACCESS_TOKEN" \
-t "$SCENARIO_ID" \
-e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" \
-r cli,junit
apidog run \
--access-token "$APIDOG_ACCESS_TOKEN" \
-t "$SCENARIO_ID" \
-e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" \
-r cli,junit
Một assertion thất bại sẽ làm CI job thất bại. Báo cáo JUnit giúp lưu kết quả của cả hai lần chạy. Với output thay đổi giữa các lần gọi, xem cách kiểm tra tác nhân AI không xác định.
Câu hỏi thường gặp
GPT-6.1 Sol có đắt hơn GPT-6 Sol không?
Không. Cả hai có giá $2 cho input và $10 cho output mỗi 1M token. GPT-6.1 Sol giảm giá cached input từ $0.20 xuống $0.10, nên workload dùng cache nhiều sẽ rẻ hơn.
Tôi nên làm gì với reasoning.effort: "none"?
GPT-6.1 Sol không hỗ trợ none hoặc minimal. Ánh xạ cả hai sang low, loại bỏ temperature và top_p, sau đó chạy lại eval trước khi chuyển traffic.
Tôi có thể dùng GPT-6.1 Sol với Chat Completions không?
Có, nhưng chỉ cho request không dùng công cụ. Tool calling cần dùng Responses API.
Có tầng API GPT-6.1 Sol miễn phí không?
Không. API được tính phí theo token từ request đầu tiên. Xem GPT-6.1 Sol có miễn phí không? để biết các lộ trình chi phí thấp nhất.
Bước tiếp theo
Lưu request đầu tiên, chạy nó trên gpt-6-sol với effort hiện tại, sau đó chạy trên gpt-6.1-sol. So sánh usage, assertion và output bằng prompt lấy từ traffic thực tế của bạn.
Tải Apidog để lưu hai lần chạy thành các assertion có thể chạy lại trong CI. Nếu đang cân nhắc Anthropic, xem GPT-6.1 Sol so với Claude Sonnet 5.5.
Top comments (0)