DEV Community

Cover image for Hướng dẫn sử dụng GPT-6.1 Sol API?
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Hướng dẫn sử dụng GPT-6.1 Sol API?

Để gọi API GPT-6.1 Sol, gửi yêu cầu POST đến https://api.openai.com/v1/responses với "model": "gpt-6.1-sol" và API key dưới dạng Bearer token. Giá niêm yết giữ nguyên ở mức 2 đô la đầu vào và 10 đô la đầu ra cho mỗi triệu token như GPT-6 Sol, nhưng đầu vào đã cache giảm từ 0,20 đô la xuống 0,10 đô la. Khi di chuyển từ gpt-6-sol, thay đổi chính là model ID và mức reasoning.effort: GPT-6.1 Sol không hỗ trợ none hoặc minimal, vì vậy cần ánh xạ các yêu cầu này sang low.

Dùng thử Apidog ngay hôm nay

OpenAI phát hành GPT-6.1 Sol tại DevDay ngày 29 tháng 9 năm 2026. Xem tổng hợp DevDay 2026 và bài viết GPT-6.1 Sol là gì để biết thêm bối cảnh và điểm chuẩn. Bài viết này tập trung vào yêu cầu đầu tiên, cách chọn effort, các thay đổi di chuyển, giá Batch/Flex/Fast và cách kiểm thử hồi quy hai model ID bằng Apidog.

GPT-6 Sol so với GPT-6.1 Sol: những thay đổi trong API

Phần lớn thông số giữ nguyên. Dưới đây là các khác biệt cần kiểm tra dựa trên trang model GPT-6.1 Sol, trang GPT-6 Sol và hướng dẫn di chuyển GPT-6 của OpenAI.

Hạng mục gpt-6-sol gpt-6.1-sol Việc cần làm
Đầu vào / đầu ra mỗi 1M token, Standard $2 / $10 $2 / $10 Không cần thay đổi
Đầu vào đã cache mỗi 1M token $0.20 $0.10 Tính lại chi phí cache
Ghi cache mỗi 1M token $2.50 $2.50 Không cần thay đổi
Context window / đầu vào tối đa / đầu ra tối đa 1,050,000 / 922,000 / 128,000 1,050,000 / 922,000 / 128,000 Không cần thay đổi
Thời điểm cắt dữ liệu 20 tháng 4, 2026 30 tháng 4, 2026 Chạy lại các eval nhạy cảm về ngày
reasoning.effort none, low, medium, high, xhigh, max low, medium, high, xhigh, max Ánh xạ none sang low và đánh giá lại
Gọi hàm qua Chat Completions Chỉ với reasoning_effort: "none" Không hỗ trợ Chuyển tool call sang Responses API
Endpoint Chat Completions, Responses, Batch Giống nhau Không cần thay đổi
Rate limit Tier 1: 500 RPM / 500K TPM; Tier 5: 15,000 RPM / 40M TPM Giống nhau Không cần thay đổi

Trang GPT-6 Sol hiện chuyển hướng người đọc đến GPT-6.1 Sol như “mô hình Sol mới hơn”.

Gửi yêu cầu GPT-6.1 Sol đầu tiên

Đặt API key vào biến môi trường:

export OPENAI_API_KEY="your_api_key"
Enter fullscreen mode Exit fullscreen mode

Gọi Responses API:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'
Enter fullscreen mode Exit fullscreen mode

Ví dụ Python:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)

print(response.output_text)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Khi xử lý phản hồi, kiểm tra các trường sau:

  • status phải là completed. Nếu hết ngân sách đầu ra, API có thể trả về incomplete với incomplete_details.reason: "max_output_tokens". Hướng dẫn reasoning đề xuất dành ít nhất 25.000 token cho reasoning và output trong giai đoạn thử nghiệm.
  • output là một mảng. Tìm item có type: "message" và đọc output_text từ nội dung của item đó; không nên phụ thuộc vào vị trí mảng.
  • usage.output_tokens bao gồm reasoning token và được tính theo giá output token. Xem số reasoning token tại usage.output_tokens_details.reasoning_tokens.
  • usage.input_tokens_details chứa cached_tokens và cache_write_tokens, dùng để theo dõi lợi ích từ giá cache mới.

Dùng Responses API cho mọi luồng có công cụ. GPT-6.1 Sol chỉ hỗ trợ Chat Completions cho yêu cầu không dùng công cụ. Xem thêm hướng dẫn OpenAI Responses API.

Chọn mức độ nỗ lực lập luận

medium là mặc định nếu bạn không truyền reasoning.effort. Đây cũng là biến số quan trọng nhất ảnh hưởng đến chi phí, độ trễ và chất lượng.

Effort Nên bắt đầu với OpenAI báo cáo về GPT-6.1 Sol
low Chat, trích xuất, phân loại, workload trước đây dùng none Trên các cuộc hội thoại bị người dùng gắn cờ, tỷ lệ phản hồi có lỗi thực tế giảm từ 11.4% xuống 7.7%
medium Agent automation và quy trình có tool call AutomationBench 1.0.6: cao hơn Claude Opus 5.5 2.2 điểm phần trăm với chi phí khoảng một phần ba; cao hơn GPT-6 Sol 4.8 điểm phần trăm ở cùng cấu hình
high Gỡ lỗi khó, lập kế hoạch sâu Không có tuyên bố cụ thể theo effort
xhigh Đầu ra hoàn thiện, tác vụ dài không đồng bộ Không có tuyên bố cụ thể theo effort
max Computer use và tác vụ khoa học khó OSWorld 2.0: cao hơn GPT-6 Sol 7 điểm phần trăm ở mức tối đa với chi phí chưa đến một nửa

Hướng dẫn chọn model của OpenAI gợi ý medium cho công việc kỹ thuật phức tạp và xhigh cho đầu ra hoàn thiện hoặc quyết định dựa trên bằng chứng mâu thuẫn. Bài đăng ra mắt GPT-6.1 Sol cung cấp thêm các kết quả benchmark.

Lưu ý:

  1. Bộ dữ liệu đánh giá tính xác thực gồm các cuộc hội thoại từng bị gắn cờ lỗi, không phải lưu lượng truy cập thông thường.
  2. Trên Terminal-Bench Science, GPT-6 Astra vẫn đạt điểm cao nhất là 68.1%, nên OpenAI khuyến nghị Astra cho các công việc khoa học khó nhất.

Nếu workload cũ cần độ trễ thấp và dùng none, hãy bắt đầu với low, sau đó đo chất lượng, latency và chi phí trên tập dữ liệu đại diện. Nếu cần thay đổi effort trong cuộc hội thoại mà không làm mất prompt cache, thêm configuration_update thay vì đổi reasoning.effort ở cấp request.

Di chuyển từ gpt-6-sol: bốn thay đổi mã

1. Thay model ID

Đặt model ID trong biến môi trường hoặc cấu hình để dễ rollback:

export OPENAI_MODEL_ID="gpt-6.1-sol"
Enter fullscreen mode Exit fullscreen mode
response = client.responses.create(
    model=os.environ["OPENAI_MODEL_ID"],
    reasoning={"effort": "medium"},
    input="...",
)
Enter fullscreen mode Exit fullscreen mode

2. Ánh xạ none và minimal sang low

GPT-6.1 Sol không hỗ trợ none hoặc minimal.

function normalizeEffort(effort) {
  if (effort === "none" || effort === "minimal") {
    return "low";
  }

  return effort || "medium";
}
Enter fullscreen mode Exit fullscreen mode

Bắt đầu các workload từng dùng minimal tại low, rồi chạy eval trên prompt thực tế. Trên GPT-6 Astra, gửi none trả về HTTP 400, vì vậy nên sửa mapping này trước khi chuyển traffic.

3. Loại bỏ sampling parameters

Khi effort không phải none, loại bỏ:

  • temperature
  • top_p
  • top_logprobs
  • logprobs trong Chat Completions

Ví dụ payload nên chuyển từ:

{
  "model": "gpt-6-sol",
  "reasoning_effort": "none",
  "temperature": 0,
  "top_p": 1,
  "input": "..."
}
Enter fullscreen mode Exit fullscreen mode

Sang:

{
  "model": "gpt-6.1-sol",
  "reasoning": {
    "effort": "low"
  },
  "input": "..."
}
Enter fullscreen mode Exit fullscreen mode

4. Chuyển tool call từ Chat Completions sang Responses

GPT-6 Sol chỉ cho phép function calling trong Chat Completions khi dùng reasoning_effort: "none". GPT-6.1 Sol không có tổ hợp tương đương, vì vậy hãy dùng Responses API cho luồng có tool.

Sau khi thay model, chạy lại mọi test phụ thuộc vào tính thời sự vì thời điểm cắt dữ liệu thay đổi từ ngày 20 sang ngày 30 tháng 4 năm 2026. Nếu đang chuyển từ Astra sang Sol, xem hướng dẫn di chuyển GPT-6 Astra sang Sol.

Giá Batch, Flex, Fast và đầu vào đã cache

Giá mỗi 1 triệu token, theo trang giá API:

Tầng Đầu vào Đầu vào đã cache Ghi cache Đầu ra
Standard $2.00 $0.10 $2.50 $10.00
Batch $1.00 $0.05 $1.25 $5.00
Flex $1.00 $0.05 $1.25 $5.00
Fast $4.00 $0.20 $5.00 $20.00
Standard, prompt trên 272K input token $4.00 $0.20 $5.00 $15.00

Trang model GPT-6.1 Sol lưu ý rằng prompt vượt 272K input token sẽ bị tính giá gấp 2 lần cho input/cache và gấp 1.5 lần cho output trên toàn bộ request.

Chọn service tier theo workload:

{
  "model": "gpt-6.1-sol",
  "service_tier": "flex",
  "input": "..."
}
Enter fullscreen mode Exit fullscreen mode
{
  "model": "gpt-6.1-sol",
  "service_tier": "fast",
  "input": "..."
}
Enter fullscreen mode Exit fullscreen mode

"priority" cũng được chấp nhận như bí danh của fast. Fast không khả dụng với nơi cư trú dữ liệu EU. Ultrafast cho GPT-6.1 Sol “sắp ra mắt”; hiện khả dụng rộng rãi cho GPT-6 Astra. Xem chế độ OpenAI Ultrafast. Với tác vụ chạy qua đêm, dùng OpenAI Batch API.

Ước tính tiết kiệm từ prompt cache

Theo hướng dẫn prompt caching:

  • Cache read trên GPT-6.1 Sol có giá bằng 0.05x giá input.
  • Cache read trên GPT-6 Sol có giá bằng 0.1x giá input.
  • Cache write có giá bằng 1.25x giá input trên cả hai model.
  • Tiền tố cache tối thiểu là 1.024 token hiển thị.
  • Prefix đã cache đủ điều kiện ít nhất 30 phút sau lần ghi hoặc tái sử dụng cuối cùng.

Ví dụ với system prompt 50.000 token được tái sử dụng cho 1.000 request:

  • Một lần cache write: $0.125 trên cả hai model.
  • 999 lần cache read trên GPT-6 Sol: $9.99.
  • 999 lần cache read trên GPT-6.1 Sol: $5.00.

Xem thêm chiến lược chia prompt tại bộ nhớ đệm lời nhắc GPT-6.

Kiểm tra việc hoán đổi trong Apidog

Không nên chuyển production chỉ dựa trên giá niêm yết. Hãy gửi cùng một request đến cả hai model ID, sau đó so sánh output, token usage và chi phí trong Apidog.

  1. Tạo environment gồm:

    • OPENAI_API_KEY: lưu dưới dạng secret.
    • MODEL_ID: ban đầu là gpt-6-sol.
    • EFFORT: ban đầu là medium.
  2. Tạo request:

POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Body:

{
  "model": "{{MODEL_ID}}",
  "reasoning": {
    "effort": "{{EFFORT}}"
  },
  "max_output_tokens": 25000,
  "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
Enter fullscreen mode Exit fullscreen mode
  1. Thêm assertions:
  • HTTP status là 200.
  • $.status bằng completed.
  • $.output[*].type chứa message.
  • $.usage.output_tokens lớn hơn 0.
  • $.usage.output_tokens_details.reasoning_tokens tồn tại.
  • Output là JSON hợp lệ và có các key mà ứng dụng của bạn cần, ví dụ risk và fix.
  1. Thêm post-response script để tính chi phí ước tính:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};

const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");

const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;

const cost = (
  (u.input_tokens - cached - writes) * 2 +
  cached * cachedRate +
  writes * 2.5 +
  u.output_tokens * 10
) / 1e6;

console.log(model, "cost per call $", cost.toFixed(5));
Enter fullscreen mode Exit fullscreen mode
  1. Chạy request với MODEL_ID=gpt-6-sol, sau đó đổi sang gpt-6.1-sol và chạy lại. So sánh:
  • reasoning_tokens
  • output_tokens
  • Nội dung output
  • Chi phí ước tính
  • Tỷ lệ assertion pass

Nếu đang di chuyển từ none, chạy baseline với gpt-6-sol + none, rồi chạy candidate với gpt-6.1-sol + low.

Đưa request và một tập prompt thực tế vào scenario test, sau đó chạy hai model trong CI bằng Apidog CLI:

npm install -g apidog-cli

apidog run \
  --access-token "$APIDOG_ACCESS_TOKEN" \
  -t "$SCENARIO_ID" \
  -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6-sol" \
  -r cli,junit

apidog run \
  --access-token "$APIDOG_ACCESS_TOKEN" \
  -t "$SCENARIO_ID" \
  -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6.1-sol" \
  -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Một assertion thất bại sẽ làm CI job thất bại. Báo cáo JUnit giúp lưu kết quả của cả hai lần chạy. Với output thay đổi giữa các lần gọi, xem cách kiểm tra tác nhân AI không xác định.

Câu hỏi thường gặp

GPT-6.1 Sol có đắt hơn GPT-6 Sol không?

Không. Cả hai có giá $2 cho input và $10 cho output mỗi 1M token. GPT-6.1 Sol giảm giá cached input từ $0.20 xuống $0.10, nên workload dùng cache nhiều sẽ rẻ hơn.

Tôi nên làm gì với reasoning.effort: "none"?

GPT-6.1 Sol không hỗ trợ none hoặc minimal. Ánh xạ cả hai sang low, loại bỏ temperature và top_p, sau đó chạy lại eval trước khi chuyển traffic.

Tôi có thể dùng GPT-6.1 Sol với Chat Completions không?

Có, nhưng chỉ cho request không dùng công cụ. Tool calling cần dùng Responses API.

Có tầng API GPT-6.1 Sol miễn phí không?

Không. API được tính phí theo token từ request đầu tiên. Xem GPT-6.1 Sol có miễn phí không? để biết các lộ trình chi phí thấp nhất.

Bước tiếp theo

Lưu request đầu tiên, chạy nó trên gpt-6-sol với effort hiện tại, sau đó chạy trên gpt-6.1-sol. So sánh usage, assertion và output bằng prompt lấy từ traffic thực tế của bạn.

Tải Apidog để lưu hai lần chạy thành các assertion có thể chạy lại trong CI. Nếu đang cân nhắc Anthropic, xem GPT-6.1 Sol so với Claude Sonnet 5.5.

Top comments (0)