Kiến thức / Tin tức AI

Bonsai 27B VGA: 2080 Ti+ và 1080 Ti

Sau khi PrismML mở trọng số Bonsai 27B, câu hỏi thực tế của người kinh doanh Việt không còn “có chạy được không” mà là “máy nào chịu được agent loop hàng ngày”. Bài này gom số từ Hugging Face (VRAM theo context) và lab nội bộ NganAds trên GTX 1080 Ti / GTX 1660 — để bạn chọn Ternary hay 1-bit, và đặt kỳ vọng tốc độ đúng.

Bonsai 27B: nên VGA 2080 Ti trở lên — 1080 Ti vẫn chạy chậm hơn
Ảnh: Hugging Face / PrismML

Tin gì vừa xảy ra

Repo GGUF Ternary ghi footprint triển khai khoảng 7,2GB; ở context 4K tổng VRAM khoảng 8,4GB và tăng rõ khi context dài (ví dụ vùng ~14GB+ nếu kéo rất dài, tùy KV cache). Bản 1-bit nhỏ hơn (~3,5–3,9GB weights) phù hợp khi VRAM chặt. PrismML khuyến nghị Ternary cho agent/tool-calling vì giữ chất lượng tốt hơn 1-bit trên benchmark tool/agent của họ.

Lab NganAds chạy Ternary trên GTX 1080 Ti 11GB: bộ stress tool-call 30 case đạt 25/30 (~83%), tốc độ decode trung bình khoảng 15 tok/s, latency trung bình khoảng 6,4 giây mỗi case ngắn. Tức là card đời Pascal vẫn chạy Ternary + tool-call được — không phải “không chạy” — nhưng chậm hơn card RTX đời cao. Bản 1-bit trên GTX 1660 Vulkan trong lab khoảng ~10 tok/s; turn OpenClaw đầy đủ có thể kéo dài vài phút tùy prompt.

Máy nên dùng gì?

Khuyến nghị dùng hàng ngày với OpenClaw: RTX 2080 Ti trở lên (hoặc 3060 12GB, 3080, 4070… cùng/VRAM cao hơn). Context dài + nhiều tool + thinking mode cần headroom; card mạnh giảm chờ và giảm cảm giác “agent đứng hình”. PrismML công bố Ternary trên RTX 5090 có thể lên tới khoảng 134 tok/s — chỉ để đối chiếu card mạnh nhanh hơn nhiều, không phải số bạn chắc chắn đạt trên máy văn phòng.

Card thấp hơn vẫn chạy được nhưng chậm: ví dụ 1080 Ti như trên — hợp thử nghiệm, học OpenClaw, việc không gấp. Đừng kỳ vọng bằng cloud GPT nhanh. RAM hệ thống nên dư (khuyến nghị thực dụng ≥32GB khi chạy agent + trình duyệt). Chi tiết model: Ternary Bonsai 27B là gì.

Điều này nghĩa là gì với người kinh doanh Việt

Nếu đội nhỏ đang cân nhắc local agent cho Zalo/Shopee draft, hãy chọn máy theo việc: CSKH nháp vài chục tin/ngày trên 1080 Ti vẫn làm được nếu chấp nhận chờ; livestream nội dung hoặc vòng agent liên tục thì nên 2080 Ti+. Không cần mua card mới chỉ vì bài viết — có thể giữ cloud API cho bước khó và local cho dữ liệu nội bộ.

Việc có thể làm ngay

Kiểm tra tên VGA và VRAM trong Task Manager / nvidia-smi. Nếu ≥11GB và từ 2080 Ti trở lên: ưu tiên Ternary. Nếu 1080 Ti hoặc tương đương: vẫn thử Ternary, giảm context, tắt thinking khi không cần. Máy 6GB: cân nhắc 1-bit hoặc cloud. Hỏi thêm: Zalo 0983543063 · /lien-he · tin tức AI.

Số lab là kết quả vận hành nội bộ NganAds trên cấu hình đã nêu, không phải cam kết hiệu năng mọi máy. Nguồn model: Hugging Face / PrismML.

Bài liên quan

Cần chọn Ternary hay 1-bit theo máy sẵn có? Inbox Ngân Ads — Zalo 0983543063.