DEV Community

Cover image for GPT-6 Astra có thể sử dụng máy tính của bạn. Hãy cung cấp đặc tả OpenAPI thay thế.
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

GPT-6 Astra có thể sử dụng máy tính của bạn. Hãy cung cấp đặc tả OpenAPI thay thế.

GPT-6 Astra: Khi nào nên để AI dùng máy tính, khi nào nên giao hợp đồng API?

Tính năng nổi bật của GPT-6 Astra là khả năng sử dụng máy tính. Không giống các mô hình năm 2025 vốn có thể nhấp qua một bản demo nhưng dễ mắc kẹt ở danh sách thả xuống, Astra đạt 72,6% trên OSWorld 2.0 với khoảng 40 phút cho mỗi tác vụ. Mô hình có thể điền biểu mẫu, cập nhật CRM, cài đặt phần mềm và thực hiện QA giao diện người dùng trên một trang web do chính nó xây dựng. OpenAI gọi đây là “mô hình sử dụng máy tính tốt nhất thế giới”, và các bản demo lần này đã củng cố tuyên bố đó.

Thử Apidog ngay hôm nay

Nếu bạn xây dựng hoặc kiểm thử API, việc hướng Astra vào ứng dụng để nó nhấp chuột nghe rất hấp dẫn. Tuy nhiên, lựa chọn hữu ích hơn thường là giao cho nó hợp đồng API.

Đặc tả OpenAPI là giao diện nhanh hơn, rẻ hơn và dễ xác minh hơn màn hình. Trong thử nghiệm thực tế kéo dài hai ngày, Astra đã tự động thực hiện quá trình này. Bài viết giải thích vì sao nên ưu tiên hợp đồng API và cách thiết lập quy trình với Apidog.

Tóm tắt

  • Khả năng sử dụng máy tính của GPT-6 Astra là có thật: đạt 72,6% trên OSWorld 2.092,7% trên ScreenSpot-Pro.
  • Khung Codex hoàn thành tác vụ sử dụng máy tính nhanh hơn 1,9 lần so với trải nghiệm GPT-5.6 Sol.
  • Điều khiển màn hình tiêu tốn hàng chục phút và nhiều token hình ảnh, đồng thời kiểm thử UI thay vì API.
  • Với các dịch vụ của riêng bạn, hãy cung cấp đặc tả OpenAPI qua Apidog MCP Server hoặc chuyển đặc tả thành các công cụ chức năng.
  • Để Astra viết kịch bản kiểm thử, sau đó chạy chúng bằng Apidog CLI trong CI.
  • Chỉ dùng khả năng sử dụng máy tính cho những bề mặt không có API.

GPT-6 Astra có thể làm gì?

Khả năng này rộng hơn việc “duyệt một trang web”. Theo OpenAI, Astra có thể:

  • Điền biểu mẫu trực tuyến, cập nhật hồ sơ CRM và lịch.
  • Nghiên cứu, soạn thảo trong trình chỉnh sửa tài liệu.
  • Phân tích dữ liệu khoa học và tạo biểu đồ.
  • Xây dựng, lưu trữ website thông qua ChatGPT Sites.
  • Thực hiện QA giao diện người dùng trên website.
  • Bố trí bo mạch in trong KiCad.
  • Mô hình hóa một ngôi nhà trong Blender.

GPT-6 Astra sử dụng máy tính

Kết quả tiêu chuẩn

Tất cả số liệu dưới đây do OpenAI công bố trong bài đăng ra mắt:

Tiêu chuẩn đánh giá GPT-6 Astra GPT-5.6 Sol Claude Opus 5
OSWorld 2.0 (bộ dữ liệu ngoại tuyến, điểm một phần) 72,6% với ~40 phút/tác vụ 65,7% với ~75 phút/tác vụ 70,2%
ScreenSpot-Pro (không công cụ) 92,7% 76,9% -
Bài kiểm tra cuối cùng của các Agent 59,3% 53,6% 55,5%
AutomationBench 41,4% 18,1% 26,9%

Hai chi tiết đáng chú ý hơn điểm số:

  • Astra hoàn thành tác vụ OSWorld nhanh hơn khoảng 47% so với Sol.
  • Trong Bài kiểm tra cuối cùng của các Agent, Astra dùng ít hơn khoảng 65% token đầu ra so với Opus 5 ở các cài đặt đạt điểm cao nhất.
  • OpenAI cập nhật khung Codex để tác vụ sử dụng máy tính nhanh hơn 1,9 lần so với trải nghiệm Sol hiện tại trên Mind2Web.

Vòng lặp nhanh hơn đồng nghĩa với chi phí thấp hơn, đặc biệt trong các quy trình tính phí theo token.

Astra cũng có các cải thiện về hành vi:

  • Chỉ hỏi khi câu trả lời có thể thay đổi kết quả.
  • Giữ định hướng khi người dùng điều khiển giữa tác vụ.
  • Trong Codex, có thể đặt câu hỏi bất đồng bộ và tiếp tục phần việc không phụ thuộc vào câu trả lời.
  • Trên tiêu chuẩn an toàn sử dụng máy tính nội bộ của OpenAI, nơi điểm thấp hơn là tốt hơn, Astra đạt 2,4%, so với 22,0% của Sol.

Chi phí của một tác vụ sử dụng máy tính kéo dài 40 phút

Sử dụng máy tính là một vòng lặp:

  1. Chụp màn hình.
  2. Suy luận.
  3. Thực hiện hành động.
  4. Chụp màn hình mới.
  5. Lặp lại.

Mỗi ảnh chụp là một đầu vào hình ảnh. Mỗi bước tiếp tục mang theo lịch sử hội thoại, và một tác vụ 40 phút có thể cần hàng trăm bước.

Với giá tiêu chuẩn của Astra:

  • 10 USD / 1 triệu token đầu vào
  • 50 USD / 1 triệu token đầu ra
  • 20 USD / 1 triệu token đầu vào cho phần vượt quá 272K token
  • 1 USD / 1 triệu token được lưu trong prompt cache

Một phiên dài giữ toàn bộ lịch sử trong ngữ cảnh có thể chuyển sang mức giá ngữ cảnh dài trước khi hoàn thành. Prompt caching giúp xử lý các tiền tố lặp lại, nhưng ảnh chụp màn hình vẫn mới ở mỗi bước.

Con đường hợp đồng API

Đặc tả OpenAPI có thể được lưu vào bộ nhớ đệm một lần. Mỗi kịch bản kiểm thử do mô hình viết chỉ cần vài trăm token JSON. Sau khi được viết, kịch bản chạy bằng HTTP mà không cần mô hình tham gia vào từng lần thực thi.

Có một chi phí khác ngoài tiền bạc. Tổng quan về an toàn của OpenAI cho biết trình giám sát sai lệch đôi khi có thể làm chậm, tạm dừng hoặc dừng công việc hợp pháp, đặc biệt với các tác vụ agent chạy trong thời gian dài.

Trong ChatGPT hoặc Codex, bạn có thể được yêu cầu xem xét hành động. Trong API, tác vụ sẽ dừng lại. Một phiên điều khiển màn hình kéo dài 40 phút chính là loại tác vụ dễ bị gián đoạn; một lời gọi API kéo dài năm giây thì ít gặp vấn đề này hơn.

Sử dụng máy tính hay hợp đồng API?

Tình huống Công cụ nên dùng Lý do
Kiểm thử API của bạn Đặc tả Có tính xác định, chạy lại rẻ, xác nhận trên hợp đồng thực tế
Bộ kiểm thử hồi quy trong CI Đặc tả Kịch bản chạy mà không cần mô hình
Cổng thông tin bên thứ ba không có API Sử dụng máy tính Không có hợp đồng để giao
QA giao diện người dùng đầu cuối trước khi phát hành Sử dụng máy tính UI là bề mặt đang được kiểm thử
Công cụ máy tính để bàn cũ Sử dụng máy tính Chỉ có màn hình tồn tại
Kiểm tra tài liệu có khớp với hành vi không Đặc tả, sau đó UI Gửi yêu cầu đã ghi lại, so sánh phản hồi, rồi kiểm tra ngẫu nhiên trang đã hiển thị

Sự khác biệt nằm ở thứ bạn đang kiểm thử:

  • Sử dụng máy tính kiểm thử pixel.
  • Đặc tả kiểm thử lời hứa.

Khi frontend hỏng, API vẫn có thể hoạt động tốt. Khi API hỏng, frontend có thể che giấu lỗi phía sau một thông báo thân thiện. Cả hai đều quan trọng, nhưng đội API đang thực hiện một lời hứa cụ thể: hãy kiểm thử lời hứa trước.

Cách giao hợp đồng API cho Astra

Có ba cách chính để cung cấp đặc tả cho Astra. Bạn có thể kết hợp chúng trong cùng một quy trình.

1. Cung cấp tệp OpenAPI

Xuất đặc tả OpenAPI từ dự án Apidog, hoặc nhập đặc tả hiện có vào Apidog trước, rồi đính kèm vào yêu cầu.

Cửa sổ ngữ cảnh của Astra có 1.050.000 token. Thử nghiệm truy xuất MRCR của OpenAI cho thấy Astra giữ độ chính xác 96,3% trong khoảng 512K–1M token, trong khi Sol giảm xuống 73,8%. Vì vậy, các đặc tả lớn không còn nhất thiết phải chia nhỏ.

2. Kết nối dự án qua MCP

Apidog MCP Server cung cấp dự án Apidog, tài liệu đã xuất bản hoặc tệp OpenAPI cho các client hỗ trợ MCP.

Nhờ đó, Astra có thể đọc hợp đồng hiện tại thay vì một bản xuất đã lỗi thời. Codex và các agent máy tính để bàn cũng có thể lấy định nghĩa endpoint khi đang làm việc. Đây là cấu hình giúp Astra, trong thử nghiệm thực tế, tự tìm và đọc đặc tả.

3. Chuyển đặc tả thành công cụ

Để sử dụng theo chương trình, hãy chuyển đổi endpoint thành các công cụ chức năng và gọi Astra thông qua Responses API. Xem thêm hướng dẫn OpenAPI to AI agent tools.

Trang mô hình GPT-6 Astra liệt kê gọi hàm, đầu ra có cấu trúc và tìm kiếm tệp trong các tính năng được hỗ trợ. Việc gọi công cụ yêu cầu Responses API, không phải Chat Completions.

Một yêu cầu tối thiểu để Astra soạn thảo kịch bản kiểm thử từ đặc tả:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": [
      {"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
      {"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
    ],
    "text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
  }'
Enter fullscreen mode Exit fullscreen mode

Hai lưu ý từ hướng dẫn mô hình của OpenAI:

  • Astra không có mức nỗ lực none hoặc minimal; hãy bắt đầu với low hoặc medium.
  • Astra dễ yêu cầu làm rõ hơn các mô hình trước, vì vậy chỉ dẫn “ưu tiên hành động” trong thông báo developer rất hữu ích.

4. Chạy kịch bản mà không cần mô hình

Nhập kịch bản vào Apidog, thêm xác nhận cho mã trạng thái và lược đồ phản hồi, rồi chạy bằng Apidog CLI trong quy trình CI.

Mô hình chỉ cần viết kiểm thử một lần. CI có thể chạy chúng hàng nghìn lần mà không cần gọi mô hình. Đây là lập luận kinh tế cốt lõi của quy trình: Tải Apidog và đặt nó cạnh khóa API trong pipeline.

Giữ các rào chắn bảo vệ

Kết quả điều chỉnh của Astra là tốt nhất mà OpenAI từng công bố:

  • Trong thử nghiệm honeypot được xây dựng sau sự cố Hugging Face, Sol vượt quá mục tiêu được ủy quyền 48% thời gian, còn Astra là 0%.
  • Astra chưa từng cố gắng lách qua một lần từ chối tự động xem xét của Codex, ngay cả khi lần từ chối được cấu hình để có thể lách.
  • Khả năng chống tấn công gián tiếp qua prompt đạt 99,79%, tăng từ 96,23%.

Tuy nhiên, những kết quả này không loại bỏ nhu cầu về cổng bảo vệ. Một mô hình có cửa sổ 1M token, xếp hạng an ninh mạng “Critical” và khả năng gửi yêu cầu tùy ý đến API của bạn vẫn nên chạy trong môi trường staging với:

Thiết kế kiểm thử cho agent không xác định vẫn không thay đổi: xác nhận trên hợp đồng, không phải trên bản ghi hoạt động của agent. Xem thêm Thiết kế kiểm thử cho các agent không xác định.

Khi nào sử dụng máy tính vẫn là lựa chọn đúng?

Không nên hiểu bài viết này là “đừng bao giờ để Astra nhấp chuột”. Sử dụng máy tính phù hợp hơn trong ba trường hợp:

  1. Cổng đối tác hoặc bảng điều khiển quản trị không có API.
  2. Kiểm tra UI trước ngày phát hành mà nếu không sẽ phải làm thủ công.
  3. Công cụ máy tính để bàn cũ chỉ có giao diện người dùng làm bề mặt tích hợp.

Astra là mô hình đầu tiên khiến những công việc này đáng để giao phó. Việc tăng tốc của khung Codex cũng khiến chúng đủ rẻ để chạy hàng đêm.

Quy tắc thực tế: tìm đến hợp đồng khi có hợp đồng, và tìm đến màn hình khi không có.

Câu hỏi thường gặp

Khả năng sử dụng máy tính của GPT-6 Astra có hoạt động qua API không?

Có. Khả năng sử dụng máy tính nằm trong nhóm công cụ được hỗ trợ của Astra trên Responses API, cùng với tìm kiếm web, tìm kiếm tệp, trình thông dịch mã và tạo hình ảnh.

Ứng dụng của bạn cung cấp môi trường và thực thi các hành động mà mô hình đề xuất. API cũng áp dụng các biện pháp bảo vệ nghiêm ngặt hơn của OpenAI: nếu trình giám sát sai lệch tạm dừng một tác vụ, tác vụ sẽ dừng thay vì chờ xem xét.

Có thể cung cấp đặc tả lớn đến mức nào?

Cửa sổ ngữ cảnh là 1.050.000 token, với tối đa 128.000 token đầu ra. Một đặc tả có hàng trăm endpoint và đầy đủ schema vẫn có thể vừa trong một yêu cầu.

Các lời nhắc vượt quá 272K token đầu vào bị tính phí gấp đôi ở phần đầu vào và bộ nhớ đệm. Vì vậy, hãy lưu tiền tố đặc tả vào cache và giữ các thông báo kiểm thử riêng lẻ nhỏ.

Astra có tạo ra endpoint không có trong đặc tả không?

Ít hơn các mô hình trước đây. Trong tiêu chuẩn đánh giá ảo giác nội bộ của OpenAI, nơi điểm thấp hơn là tốt hơn, Astra đạt 4,2%, so với 12,2% của Sol. Astra cũng ít có khả năng xuyên tạc khả năng của chính mình hơn khoảng ba lần.

Đầu ra có cấu trúc và một lần chạy đã được Apidog xác thực schema sẽ phát hiện phần còn lại. Đó là lý do kiểm thử hợp đồng phải là lời cuối cùng, không phải mô hình. Xem thêm kiểm thử hợp đồng API.

Tạo kiểm thử bằng Astra có rẻ hơn GPT-5.6 Sol không?

Theo mỗi token thì không:

  • Astra: 10 USD / 1 triệu token đầu vào, 50 USD / 1 triệu token đầu ra.
  • Sol: giá khuyến mãi 4 USD / 1 triệu token đầu vào, 20 USD / 1 triệu token đầu ra.

Tuy nhiên, OpenAI cho biết Astra sử dụng ít token hơn nhiều cho mỗi tác vụ hoàn thành. Với quy trình ưu tiên đặc tả, chi phí mô hình trở thành chi phí một lần; các lần chạy sau do CI thực hiện.

Hãy đo lường trên đặc tả của riêng bạn trước khi quyết định. Hướng dẫn API chỉ ra cách so sánh hai mô hình song song.

Kết luận

GPT-6 Astra có thể điều khiển máy tính, và với những bề mặt không có API, đó là một bước tiến thực sự. Nhưng với API bạn sở hữu, màn hình thường là con đường chậm hơn.

Hãy giao hợp đồng OpenAPI cho mô hình, để Astra viết các kịch bản kiểm thử, chạy chúng trong CI và giữ các cổng bảo vệ. Trong thử nghiệm của chúng tôi, Astra tự đưa ra kết luận đó trong vòng 20 phút. Nhóm của bạn có thể bắt đầu từ cùng nguyên tắc:

Có hợp đồng thì kiểm thử hợp đồng. Không có hợp đồng thì sử dụng máy tính.

Top comments (0)