DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Claude Fable 5.1 rẻ hơn 25%: khi nào đáng đổi model?

Originally published on NextFuture

Anthropic vừa phát hành Claude Fable 5.1, giá thấp hơn Fable 5 khoảng 25% ở mức thông thường và tới 45% cho tác vụ agentic phức tạp.

The Verge dẫn lời Anthropic rằng mức giảm đến từ "reduced pricing on cached data that was already processed and stored" — phần dữ liệu đã xử lý và lưu lại từ trước. Đây là chi tiết quyết định việc bạn có tiết kiệm được hay không.

Vì sao 45% chỉ dành cho agentic

Hai con số này không phải hai mức giảm giá song song. Chúng là cùng một cơ chế nhìn từ hai loại workload khác nhau: 25% là mức chung, 45% là mức tốt nhất khi phần lớn token đầu vào của bạn là context đã được cache.

Phân tích: một agent loop đọc lại cùng một khối system prompt, tool schema và lịch sử qua nhiều lượt gọi, nên tỷ lệ cache hit tự nhiên cao hơn một request chat đơn lẻ. Nếu pipeline của bạn là chat một lượt với prompt luôn thay đổi, hãy tính theo mức 25%, không phải 45%. Anthropic không công bố giá tuyệt đối trên mỗi token trong các bản tin này — chỉ có tỷ lệ tương đối.

Ba thay đổi không nằm ở giá

Safeguards bớt chặn sai. Fable 5.1 có "more precise safeguards" mà Anthropic nói ít khả năng chặn các câu hỏi sinh học cơ bản hơn Fable 5. Lưu ý: Mythos 5.1 vẫn giữ nguyên các giới hạn sinh học của model trước. TechCrunch mô tả đây là thay đổi nhằm giảm "false-positive restrictions".

Mở cho việc tìm lỗ hổng. Anthropic nói "now allowing Fable 5.1 to be used for identifying software vulnerabilities", nhưng vẫn chuyển một số tác vụ security sang các model Opus — cụ thể là "penetration testing, exploit generation, and binary-based vulnerability scanning". Nếu team bạn làm security, đọc kỹ ranh giới này trước khi đổi model trong pipeline.

Zero data retention, nhưng chưa phải hôm nay. Dịch vụ Enterprise Frontier Safeguards lưu dữ liệu trên cloud của chính khách hàng thay vì của Anthropic, và theo cả The Verge lẫn TechCrunch, nó sẽ bắt đầu triển khai vào mùa thu này. TechCrunch lưu ý hệ thống vẫn giám sát lạm dụng, nhưng khách hàng kiểm soát cách giám sát diễn ra.

Đo gì trước khi đổi

  • Đo tỷ lệ cache hit thực tế của prompt hiện tại. Đây là biến quyết định bạn nằm gần 25% hay 45%.

  • So chi phí trên một task hoàn chỉnh, không so giá đơn vị. Model rẻ hơn mà cần nhiều lượt hơn thì không rẻ hơn.

  • Chạy lại đúng những prompt từng bị safeguard chặn sai. Đó là phần thay đổi khó đo bằng benchmark công khai.

  • Nếu bạn đang chờ zero data retention để đưa dữ liệu nội bộ vào, mốc là mùa thu — đừng lên kế hoạch go-live theo hôm nay.

Đọc các review sớm với thái độ nào

Đây là các phát biểu của người có quyền lợi liên quan, không phải kết quả đo độc lập. CEO Every, Dan Shipper, nói với The Verge: "It's the strongest coding model we've used, but now it's fast, token-efficient, and crucially actually speaks like a normal person." CEO Box, Aaron Levie, nói agent của công ty ông dùng Fable 5.1 nhận ra được những chi tiết mơ hồ trong dữ liệu mà Fable 5 bỏ sót trong cùng một bài test. Cả hai đều thuộc nhóm early access.

Điều đáng theo dõi

  • Số benchmark thật. TechCrunch nói bộ model mới lập kỷ lục ở một loạt benchmark, trong đó có Terminal-Bench 4.0 (coding qua CLI) và Humanity's Last Exam (reasoning tổng quát) — nhưng bản tin không kèm điểm cụ thể. Chờ số trước khi dùng nó làm căn cứ chọn model.

  • Đừng lên kế hoạch quanh Mythos 5.1. Nó chỉ mở cho partner đã đăng ký trong lĩnh vực cybersecurity hoặc life sciences, và chỉ có trong Project Glasswing. Fable 5.1 mới là bản có sẵn trên các nền tảng cloud và qua Anthropic API.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)