Bầy AI biết phối hợp: Cursor và Anthropic chứng minh tổ chức quan trọng hơn model mạnh
Bầy AI biết phối hợp: Tổ chức quan trọng hơn model mạnh

Cursor, công ty đứng sau công cụ lập trình AI cùng tên, vừa thực hiện một thí nghiệm táo bạo: giao cho một nhóm nhiều AI làm việc song song (gọi là "agent swarm" hay "bầy AI") tự viết lại toàn bộ SQLite bằng ngôn ngữ Rust. Kết quả công bố trên blog chính thức của Cursor ngày 20/7 cho thấy cách tổ chức công việc giữa các AI quan trọng hơn nhiều so với việc chọn mô hình đắt tiền nhất.

Thí nghiệm SQLite: Cùng model, khác tổ chức, khác kết quả

Bầy AI chỉ được đưa bản tài liệu hướng dẫn dài 835 trang, không có mã nguồn gốc, không có bộ đề kiểm tra, cũng không được truy cập internet. Cursor từng thử bài toán này với phiên bản bầy AI cũ nhưng thất bại. Lần này, họ so sánh trực tiếp bản cũ và bản mới, dùng cùng một model AI tên Grok 4.5, chạy trong cùng 4 tiếng.

Bản bầy AI cũ tạo ra 68.000 lượt commit chỉ trong 2 giờ đầu, nhưng liên tục gặp "xung đột" – khi hai AI cùng sửa một đoạn code theo hai hướng khác nhau. Bản cũ dính hơn 70.000 xung đột và phải dừng giữa chừng; riêng một file bị 1.173 AI khác nhau chỉnh sửa chồng chéo tới 7.771 lần. Ngược lại, bản bầy AI mới, dùng đúng model đó, chỉ gặp chưa tới 1.000 xung đột trong suốt 4 giờ, và cuối cùng vượt qua 100% bộ đề kiểm tra bí mật của Cursor.

Banner rộng Pickt — ứng dụng danh sách mua sắm cộng tác cho Telegram

Kiến trúc sư và thợ: Bí quyết tổ chức

Câu trả lời nằm ở cách tổ chức công việc. Bầy AI mới của Cursor hoạt động như một công trường xây dựng: một nhóm AI đóng vai "kiến trúc sư", dùng model AI mạnh và đắt nhất để chia nhỏ công việc và quyết định thiết kế tổng thể; một nhóm AI khác đóng vai "thợ", dùng model rẻ và nhanh hơn để thực thi từng phần việc cụ thể. AI kiến trúc sư không bao giờ tự tay viết code, còn AI thợ không phải lo nghĩ bức tranh toàn cảnh.

Mỗi khi một AI đọc hoặc viết ra văn bản, hệ thống tính phí theo đơn vị "token". Cursor thử 4 cách phối hợp model khác nhau cho cùng bài toán SQLite, và độ chênh lệch chi phí lên tới gần 8 lần. Nếu để một model mạnh như GPT-5.5 tự làm hết, tổng chi phí lên tới 10.565 USD (khoảng 279 triệu đồng). Nhưng nếu để Opus 4.8 làm kiến trúc sư và Composer 2.5 (model rẻ hơn) làm thợ, tổng chi phí chỉ còn 1.339 USD (khoảng 35 triệu đồng), trong khi chất lượng đầu ra gần như tương đương.

Điều thú vị là không phải cứ ghép AI kiến trúc sư xịn với AI thợ rẻ là luôn tiết kiệm nhất. Khi Cursor thử để model Fable 5 làm kiến trúc sư thay cho Opus 4.8, nhóm này suy nghĩ ít hơn khi lên kế hoạch, nhưng bản kế hoạch kém rõ ràng khiến đội thợ phải làm nhiều việc hơn gấp vài lần để bù lại, kéo tổng chi phí lên cao hơn hẳn.

Anthropic dùng bầy AI viết lại Bun từ Zig sang Rust

Trước đó, Anthropic (công ty tạo ra Claude) cũng làm một việc tương tự trên sản phẩm thật. Tháng 12/2025, Anthropic mua lại Bun, một công cụ chạy JavaScript nhanh hơn Node.js. Jarred Sumner, người sáng lập Bun, tiếp tục dẫn dắt dự án. Từ ngày 3 đến 14/5, Jarred Sumner cho khoảng 64 AI Claude chạy song song, dùng bản Claude Fable 5 chưa phát hành chính thức, để viết lại toàn bộ gần 1 triệu dòng code của Bun từ Zig sang Rust.

Theo Jarred Sumner, nếu làm bằng tay, việc này cần 3 kỹ sư làm trong khoảng một năm. Bầy AI hoàn tất chỉ sau 11 ngày, tiêu tốn khoảng 165.000 USD (khoảng 4,3 tỷ đồng) tiền vận hành AI, thấp hơn nhiều so với chi phí nhân sự ước tính từ 300.000 đến 500.000 USD (khoảng 7,9 đến 13,2 tỷ đồng) cho cùng khối lượng công việc.

Banner sau bài viết Pickt — ứng dụng danh sách mua sắm cộng tác với hình minh họa gia đình

Để kiểm soát chất lượng, mỗi đoạn code do một AI viết ra sẽ có thêm hai AI khác đóng vai phản biện, với nhiệm vụ duy nhất là tìm ra lý do khiến đoạn code đó sai. Cách làm này giúp phát hiện một lỗi "use after free" – lỗi xảy ra khi phần mềm vẫn cố dùng một vùng nhớ đã bị xóa, có thể khiến chương trình treo hoặc bị khai thác thành lỗ hổng bảo mật. Lỗi này nằm trong phần code xử lý tiến trình và được bắt trước khi hợp nhất vào nhánh chính.

Bản viết lại sau đó vượt qua toàn bộ bộ đề kiểm tra có sẵn của Bun, với hơn 1 triệu phép thử, đồng thời giảm rò rỉ bộ nhớ, giảm kích thước file cài đặt và tăng nhẹ tốc độ xử lý mạng. Ngay cả Claude Code, công cụ lập trình của chính Anthropic, cũng chuyển sang chạy trên bản Rust này từ giữa tháng 6 và khởi động nhanh hơn 10% trên hệ điều hành Linux.

Phản biện và bài học

Không phải ai cũng đồng tình. Andrew Kelley, người tạo ra ngôn ngữ Zig, công khai chỉ trích chất lượng code trong bản viết lại, cho rằng vấn đề nằm ở nợ kỹ thuật tồn đọng nhiều năm của Bun chứ không phải do bản thân Zig có lỗi. Theo Andrew Kelley, Jarred Sumner "đã viết code lộn xộn từ trước khi có mô hình ngôn ngữ lớn".

Đặt cạnh nhau, hai câu chuyện của Cursor và Anthropic cùng chỉ ra một điểm chung: một bầy AI biết phối hợp có thể làm những việc từng cần cả đội kỹ sư làm trong nhiều tháng, với chi phí chỉ bằng một phần nhỏ. Nhưng phần khó nhất vẫn là kiểm soát chất lượng, và không phải chuyên gia nào cũng tin rằng code do AI viết ra đã đủ đáng tin để giao toàn quyền.

Toàn bộ chi tiết dự án Bun được Jarred Sumner đăng trên blog chính thức tại bun.com/blog/bun-in-rust ngày 8/7. Báo cáo của Cursor về SQLite, tựa đề "Agent swarms and the new model economics", do kỹ sư Wilson Lin viết, xuất hiện trên blog công ty này ngày 20/7, kèm mã nguồn công khai tại github.com/anysphere/minisqlite.