DEV Community

BeanBean
BeanBean

Posted on • Originally published at nextfuture.io.vn

Kog: tối ưu GPU thường để tăng tốc suy luận LLM, không cần chip riêng

Originally published on NextFuture

Nếu bạn từng đợi hàng giờ để agent như Claude Code trả kết quả, đó chính là vấn đề mà startup Pháp Kog đang nhắm tới — không phải bằng chip chuyên dụng như Cerebras, mà bằng cách tối ưu phần mềm trên GPU tiêu chuẩn doanh nghiệp đã sở hữu sẵn.

Vấn đề: GPU thường bị coi là không hợp với suy luận agentic

Kog cho rằng quan niệm "GPU tiêu chuẩn không phù hợp với workload agentic" là một ngộ nhận. Tháng 5, startup này gây chú ý trên Hacker News với bản demo chứng minh việc giải mã single-request tốc độ cao là khả thi trên GPU trung tâm dữ liệu tiêu chuẩn như AMD MI300X và Nvidia H200 — cùng loại phần cứng nhiều doanh nghiệp đã đầu tư.

Con số từ demo — và giới hạn của nó

Demo của Kog đạt 3.000 token mỗi giây cho mỗi request, nhưng chạy trên một model nhỏ mã nguồn mở tên Laneformer 2B — chỉ khoảng 2 tỷ tham số. CEO Gaël Delalleau thừa nhận công ty còn "một bước nhảy lớn" để hiện thực hoá lời hứa "tăng tốc suy luận LLM gấp 30 lần" — đây là tuyên bố của Kog, chưa được kiểm chứng trên model lớn thực tế. Theo Delalleau, thị trường chưa sẵn sàng fine-tune model nhỏ, nên từ sau demo, đội ngũ đã tập trung mở rộng sang các model lớn hơn để đáp ứng nhu cầu thực tế.

Vì sao dev quan tâm

Delalleau cho biết công ty nhận được 200 lead kinh doanh cụ thể sau demo, và mảng dùng thử sớm nhất dự kiến là kỹ sư phần mềm — nhóm quen thuộc với việc đợi lâu để agent trả kết quả. Đây cũng là lý do Anthropic tính phí cao hơn cho Fast Mode của Claude: tốc độ suy luận có giá trị kinh tế rõ ràng. Kog còn có design partner cho phép người dùng tạo game và app bằng prompt, nơi suy luận nhanh hơn đồng nghĩa doanh thu cao hơn.

Không đơn độc trong hướng đi này

Kog không phải startup Pháp duy nhất đặt cược vào tối ưu phần mềm cho GPU: ZML, cũng từ Pháp, phát hành phần mềm hardware-agnostic bỏ qua CUDA của Nvidia để chạy suy luận nhanh trên nhiều loại chip cạnh tranh. Theo Delalleau, Kog gần với hướng nghiên cứu của phòng lab Hazy Research (Stanford) hơn là một sản phẩm thương mại thuần tuý — tập trung sâu vào tầng tăng tốc GPU.

Điều cần theo dõi

Với dev đang tối ưu chi phí và độ trễ cho AI agent, điểm đáng chú ý không phải con số 30x (vẫn là tuyên bố chưa kiểm chứng ở quy mô lớn) mà là hướng đi: tận dụng GPU đã có sẵn trong hạ tầng thay vì đầu tư chip chuyên dụng mới. Nếu Kog mở rộng thành công sang model lớn, đây có thể là lựa chọn đáng cân nhắc trước khi quyết định mua thêm phần cứng suy luận chuyên dụng.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)