10 Paper AI Hot Nhất Trên Hugging Face Hôm Nay: Open LLM, Agent, Robotics, DataPrep và Video Generation
Hôm nay, bảng xếp hạng paper trên Hugging Face cho thấy một bức tranh rất rõ về hướng đi hiện tại của AI: mô hình mở mạnh hơn, agent thực dụng hơn, benchmark chuyên biệt hơn, và tối ưu hiệu quả huấn luyện/suy luận ngày càng quan trọng. Dưới đây là phần tổng hợp 10 paper được upvote cao nhất, tập trung vào 4 câu hỏi cho mỗi bài:
- Bài toán
- Ý tưởng
- Điểm mới
- Ứng dụng thực tế
1) Kimi K3: Open Frontier Intelligence
Paper: 2607.24653
GitHub: https://github.com/MoonshotAI/Kimi-K3
Project: https://www.kimi.com/blog/kimi-k3
Bài toán
Các open model hiện nay đã tiến rất xa, nhưng vẫn thường gặp khoảng cách với frontier proprietary model ở các năng lực như reasoning dài, coding, tool use và khả năng làm việc tổng quát ở quy mô lớn.
Ý tưởng
Kimi K3 được giới thiệu như một nỗ lực đưa “frontier intelligence” sang phía open-weight/open ecosystem. Hướng tiếp cận nhiều khả năng là kết hợp:
- pretraining quy mô lớn,
- instruction tuning chất lượng cao,
- tăng cường reasoning/agentic behaviors,
- tối ưu suy luận để triển khai thực tế.
Điểm mới
Điểm nổi bật của paper này nằm ở tham vọng: không chỉ tạo một open model “khá tốt”, mà là một mô hình có mục tiêu cạnh tranh ở biên trên của năng lực AI hiện tại. Nếu benchmark xác nhận, đây có thể là một bước tiến quan trọng giúp cộng đồng mã nguồn mở rút ngắn khoảng cách với mô hình đóng.
Ứng dụng thực tế
- trợ lý doanh nghiệp nội bộ
- coding assistant on-premise
- agent dùng công cụ trong môi trường cần kiểm soát dữ liệu
- nền tảng xây dựng sản phẩm AI không phụ thuộc API đóng
2) JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Paper: 2607.23588
GitHub: https://github.com/LYL1015/JarvisHub
Project: https://www.jarvishub.site/
Bài toán
Các multimodal agent hiện có thể nhìn, viết, nghe, nhưng khi bước vào các tác vụ sáng tạo như thiết kế, chỉnh sửa canvas, dựng bố cục, kết hợp nhiều công cụ thì vẫn thiếu một harness chuẩn để huấn luyện và đánh giá.
Ý tưởng
JarvisHub xây dựng một môi trường/harness mở cho canvas-native creative agents. Thay vì chỉ trả lời văn bản hoặc sinh ảnh một lần, agent có thể thao tác trực tiếp trên canvas, chỉnh sửa lặp, phối hợp đa phương thức, và làm việc giống một “creative copilot”.
Điểm mới
- Nhấn mạnh vào canvas-native interaction, thay vì text-native.
- Tập trung vào creative workflow, khác với các benchmark agent thiên về QA hay browser automation.
- Có thể đóng vai trò là hạ tầng chung để benchmark agent sáng tạo đa phương thức.
Ứng dụng thực tế
- trợ lý thiết kế marketing
- tạo slide/poster/banner bán tự động
- đồng sáng tạo với nhà thiết kế
- hệ thống AI hỗ trợ chỉnh sửa nội dung hình ảnh theo nhiều vòng phản hồi
3) From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
Paper: 2607.24280
Bài toán
Trong agentic search, mô hình đóng thường hoạt động tốt hơn nhờ dữ liệu, công cụ và quy trình suy luận phong phú. Khi chuyển sang open-source model, thường xuất hiện distribution gap: mô hình mở không tái hiện được hành vi giải quyết nhiệm vụ của hệ thống đóng.
Ý tưởng
Paper đề xuất dùng multi-agent protocol distillation. Tức là không chỉ distill đáp án cuối cùng, mà distill cả giao thức tương tác giữa nhiều agent: ai tìm kiếm gì, phản biện ra sao, tổng hợp thông tin thế nào.
Điểm mới
Điểm rất hay là xem năng lực agent không chỉ nằm trong “kiến thức của model”, mà còn nằm trong protocol phối hợp. Distill protocol giúp open model học được cấu trúc giải bài giống hệ thống mạnh hơn, thay vì chỉ bắt chước output.
Ứng dụng thực tế
- xây dựng search agent mã nguồn mở
- trợ lý nghiên cứu có quy trình kiểm chứng tốt hơn
- doanh nghiệp muốn nội địa hóa agent search thay vì dùng nền tảng đóng
- huấn luyện hệ multi-agent chi phí thấp hơn
4) K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
Paper: 2605.09635
GitHub: https://github.com/haolpku/K12-Dataset
Project: https://haolpku.github.io/K12-KGraph-page/
Bài toán
LLM cho giáo dục thường thiếu cấu trúc chương trình học rõ ràng. Chúng có thể trả lời đúng từng câu hỏi riêng lẻ, nhưng không nắm chắc quan hệ tiên quyết, mạch kiến thức, hay độ phù hợp với từng lớp học.
Ý tưởng
K12-KGraph xây dựng một knowledge graph bám sát curriculum K-12, dùng để benchmark và huấn luyện educational LLM. Kiến thức không còn là tập câu hỏi rời rạc mà được tổ chức thành đồ thị các khái niệm, quan hệ và lộ trình học.
Điểm mới
- Căn chỉnh trực tiếp với chương trình học phổ thông.
- Dùng knowledge graph thay vì chỉ dataset QA.
- Hỗ trợ cả đánh giá lẫn huấn luyện mô hình giáo dục.
Ứng dụng thực tế
- gia sư AI theo lớp và theo môn
- hệ thống gợi ý lộ trình học cá nhân hóa
- phát hiện lỗ hổng kiến thức của học sinh
- tạo bài tập bám chuẩn đầu ra
5) Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
Paper: 2607.21655
GitHub: https://github.com/sterzhang/Awesome-Progress-Models
Bài toán
Trong robotics, reward sparse là vấn đề rất khó: robot chỉ biết “thành công/thất bại” ở cuối hành động, nên học chậm và không ổn định. Cần cách đo mức độ tiến bộ từng bước.
Ý tưởng
Đây là một bài survey về progress reward modeling: xây dựng tín hiệu thưởng phản ánh robot đang tiến gần mục tiêu đến đâu, thay vì chỉ chấm điểm ở đích cuối.
Điểm mới
Vì là survey, điểm mới nằm ở việc hệ thống hóa:
- các loại progress signal,
- cách học reward từ video/demonstration/state,
- ứng dụng trong long-horizon manipulation,
- thách thức đánh giá và tổng quát hóa.
Ứng dụng thực tế
- robot gắp đặt đồ vật
- robot thao tác nhiều bước trong nhà máy
- học từ demonstration hiệu quả hơn
- tăng sample efficiency cho reinforcement learning trong robot
6) DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Paper: 2607.20465
GitHub: https://github.com/OpenDCAI/Data-Preparation-Bench
Project: https://datapreparationbench.github.io/
Bài toán
Ngày càng nhiều người dùng LLM để chuẩn bị dữ liệu huấn luyện: làm sạch, gán nhãn, lọc, chuẩn hóa, viết lại, sinh dữ liệu tổng hợp. Nhưng chưa có benchmark tốt để đánh giá LLM ở vai trò “data preparator”.
Ý tưởng
DataPrep-Bench đưa ra benchmark chuyên cho năng lực chuẩn bị dữ liệu của LLM, thay vì chỉ đo QA hay coding. Mục tiêu là đánh giá model có giúp tạo ra dữ liệu train tốt hơn hay không.
Điểm mới
- Chuyển trọng tâm từ “LLM as model” sang “LLM as data engineer”.
- Đánh giá theo workflow data-centric AI.
- Có giá trị thực tế rất cao vì nhiều pipeline hiện nay phụ thuộc vào bước làm dữ liệu hơn là bản thân kiến trúc model.
Ứng dụng thực tế
- tự động cleaning dataset
- chuẩn hóa annotation trước fine-tuning
- lọc dữ liệu web quy mô lớn
- xây pipeline synthetic data có kiểm soát
7) StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Paper: 2607.22798
Bài toán
Computer-use agent thường dựa mạnh vào ảnh chụp màn hình. Điều này tốn tài nguyên, dễ nhiễu, và khó mở rộng cho nhiệm vụ dài nhiều bước. Với các môi trường có cấu trúc, chỉ nhìn pixel có thể là cách quá gián tiếp.
Ý tưởng
StateAct đề xuất ưu tiên program state trước pixels. Tức là agent nên tận dụng trạng thái có cấu trúc của ứng dụng/giao diện/hệ thống trước khi dựa vào ảnh chụp màn hình.
Điểm mới
- Đảo chiều tư duy phổ biến hiện nay: từ “vision-first” sang “state-first”.
- Rất phù hợp với long-horizon tasks, nơi theo dõi trạng thái và biến môi trường quan trọng hơn nhận diện hình ảnh thuần túy.
- Gợi mở hướng thiết kế agent hiệu quả hơn, đáng tin cậy hơn.
Ứng dụng thực tế
- agent thao tác phần mềm doanh nghiệp
- tự động hóa workflow văn phòng
- kiểm thử giao diện/app
- tác vụ lặp trên desktop/web với chi phí suy luận thấp hơn
8) SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
Paper: 2607.21553
Project: https://nvlabs.github.io/Sana/Video2
Bài toán
Video generation rất tốn bộ nhớ và compute vì attention trên chuỗi không gian-thời gian dài. Muốn scale video model mà vẫn hiệu quả là bài toán then chốt.
Ý tưởng
SANA-Video 2.0 đề xuất hybrid linear attention kết hợp với attention residuals để giữ được hiệu quả tính toán nhưng không mất quá nhiều chất lượng biểu diễn.
Điểm mới
- Kết hợp linear attention với residual design để cân bằng giữa efficiency và quality.
- Hướng tới video generation thực dụng hơn, thay vì chỉ tăng brute-force compute.
- Có thể là đóng góp đáng kể cho các model video độ dài cao hoặc độ phân giải cao.
Ứng dụng thực tế
- text-to-video nhanh hơn
- tạo video marketing, concept video
- mô phỏng hoạt cảnh cho game/film pre-visualization
- giảm chi phí inference/training cho video foundation model
9) Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Paper: 2607.24731
GitHub: https://github.com/rethinking-cfg-opd/Rethinking-CFG-OPD
Project: https://rethinking-cfg-opd.github.io
Bài toán
Classifier-Free Guidance (CFG) là kỹ thuật cốt lõi trong diffusion, nhưng khi đưa vào on-policy diffusion distillation, cách dùng CFG truyền thống có thể không còn tối ưu.
Ý tưởng
Paper xem xét lại vai trò của CFG trong quá trình distillation on-policy, có thể chỉ ra rằng cách áp guidance hiện tại tạo ra lệch phân phối, mất ổn định hoặc kém hiệu quả.
Điểm mới
- Không chỉ cải tiến mô hình, mà chất vấn một giả định gần như mặc định trong diffusion.
- Tập trung vào bối cảnh distillation, nơi mục tiêu là sinh mẫu nhanh hơn nhưng vẫn giữ chất lượng.
- Đây là kiểu paper có thể tạo ảnh hưởng lớn vì một thay đổi nhỏ ở training recipe có thể áp dụng rộng.
Ứng dụng thực tế
- tăng tốc image generation
- distill model nhỏ cho deploy edge/real-time
- giảm latency hệ diffusion trong sản phẩm sáng tạo
- cải thiện stability khi huấn luyện distilled generative model
10) Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Paper: 2607.22529
GitHub: https://github.com/Qwen-Applications/skill-self-play
Bài toán
LLM thường học kỹ năng từ static dataset. Nhưng năng lực cao cấp, đặc biệt là planning, tool use, decomposition, lại cần quá trình phát triển động, nơi kỹ năng mới sinh ra nhu cầu cho kỹ năng khác.
Ý tưởng
Skill Self-Play khai thác cơ chế co-evolving skills: mô hình hoặc hệ agent tự tạo ra thách thức mới, học kỹ năng mới, rồi dùng các kỹ năng đó để tiếp tục mở rộng vùng năng lực.
Điểm mới
- Áp tinh thần self-play sang phát triển kỹ năng của LLM.
- Thay vì tối ưu trên benchmark cố định, mô hình có thể tự tạo curriculum.
- Phù hợp với ý tưởng open-ended learning, nơi khả năng không bị đóng khung bởi dữ liệu ban đầu.
Ứng dụng thực tế
- huấn luyện agent đa năng hơn
- cải thiện tool-use và planning
- tạo dữ liệu curriculum tự động cho post-training
- xây hệ thống có khả năng tự mở rộng năng lực theo nhiệm vụ mới
Nhìn rộng hơn: 4 xu hướng lớn từ top paper hôm nay
1. Open model đang tiến vào vùng “frontier”
Kimi K3 và paper về distillation trong agentic search cho thấy cộng đồng open-source không còn chỉ chạy theo mô hình đóng, mà đang tìm cách tái tạo cả năng lực lẫn quy trình suy luận.
2. Agent không chỉ là chat nữa
JarvisHub và StateAct phản ánh sự chuyển dịch từ chatbot sang agent thao tác trong môi trường thực: canvas, desktop, web app, phần mềm có trạng thái.
3. Data và benchmark trở thành lợi thế chiến lược
K12-KGraph và DataPrep-Bench nhấn mạnh rằng tiến bộ AI không chỉ đến từ kiến trúc lớn hơn, mà từ dữ liệu có cấu trúc hơn và đánh giá sát workflow thực tế hơn.
4. Hiệu quả tính toán là chủ đề trung tâm
SANA-Video 2.0 và paper về CFG trong diffusion distillation cùng tập trung vào câu hỏi rất thực dụng: làm sao giữ chất lượng trong khi giảm chi phí training/inference.
Kết luận
Nếu phải tóm gọn top 10 paper hôm nay trong một câu, thì đó là: AI đang trưởng thành theo hướng vừa mở hơn, vừa thực dụng hơn.
- Kimi K3 đại diện cho tham vọng open frontier model.
- JarvisHub và StateAct mở rộng khái niệm agent sang tương tác môi trường thực sự.
- K12-KGraph và DataPrep-Bench nhắc chúng ta rằng dữ liệu và benchmark đúng bài toán còn quan trọng không kém model.
- SANA-Video 2.0 và Rethinking CFG cho thấy tối ưu hiệu quả vẫn là chìa khóa để AI đi vào sản phẩm.
- Skill Self-Play và multi-agent protocol distillation gợi ý rằng tương lai của huấn luyện LLM có thể dựa nhiều hơn vào quá trình tự tiến hóa năng lực thay vì chỉ học từ corpora tĩnh.
Đây là một danh sách rất đáng theo dõi, đặc biệt nếu bạn quan tâm đến open-source AI, agent systems, robotics learning, hoặc generative modeling. Nếu muốn, tôi có thể viết tiếp phần 2 dưới dạng:
- bảng so sánh 10 paper, hoặc
- phiên bản ngắn gọn kiểu newsletter 5 phút đọc.
Top comments (0)