AI mở & chạy cục bộ

Thử thách lập trình với một mô hình duy nhất của Wagtail: Bài học từ 2 tỷ token

Một nhà phát triển Wagtail đã thử nghiệm sử dụng duy nhất GLM 5.3 Flash trong suốt một tháng lập trình. Những hạn chế về hạ tầng và chi phí nguyên mẫu đã buộc họ phải chuyển sang các mô hình khác vào giữa tháng.

Được dịch tự động từ bản gốc tiếng Anh.

Vào tháng 9 năm 2026, một nhà phát triển cốt lõi tại Wagtail CMS đã cố gắng giới hạn tất cả các tác vụ lập trình cho một mô hình mã nguồn mở hiệu quả duy nhất là GLM 5.3 Flash. Thí nghiệm này đã tiêu tốn 2 tỷ token nhưng không thể duy trì ràng buộc "một mô hình duy nhất" do những nút thắt cổ chai về hạ tầng và chi phí cao cho việc tạo nguyên mẫu.

Điều gì đã xảy ra

Mục tiêu rất đơn giản: dành trọn vẹn cả tháng chỉ để sử dụng GLM 5.3 Flash cho công việc phát triển. Trong nửa đầu tháng 9, chiến lược này vẫn được tuân thủ nghiêm ngặt. Mức sử dụng nằm trong ngân sách chặt chẽ 68 USD, tiêu thụ khoảng 4 kWh năng lượng và tạo ra 365 gram khí thải carbon. Thành công ban đầu này chứng minh rằng các mô hình gọn nhẹ, hiệu quả có thể xử lý các tác vụ kỹ thuật tiêu chuẩn mà không làm vỡ ngân sách hay gây hại cho môi trường.

Tuy nhiên, nửa sau của tháng đã chứng kiến sự lệch hướng đáng kể. Khoảng 1 tỷ token đã được chi tiêu cho các mô hình thay thế, chia đôi tổng mức sử dụng giữa mô hình mục tiêu và các mô hình khác. Nhà phát triển lưu ý rằng mặc dù thử thách về mặt kỹ thuật đã không đáp ứng được tiêu chí khắt khe "một mô hình duy nhất", dữ liệu thu thập được đã cung cấp những hiểu biết quan trọng về những hạn chế thực tế khi phụ thuộc vào một nhà cung cấp suy luận hoặc kiến trúc mô hình cụ thể trong môi trường giống như sản xuất.

Nhiều yếu tố đã góp phần dẫn đến sự thay đổi này. Nhóm gặp phải các vấn đề bất ngờ về khả năng sẵn có của hạ tầng từ các nhà cung cấp đã chọn. Vì GLM 5.3 Flash nằm ở vị trí cao trên đường biên Pareto đối với khối lượng công việc cụ thể của họ, nó cũng trở thành lựa chọn phổ biến của nhiều người dùng khác. Các nhà cung cấp dịch vụ suy luận nhỏ hơn thiếu năng lực GPU so với các phòng thí nghiệm lớn, dẫn đến suy giảm hiệu suất. Để duy trì năng suất, nhà phát triển đã chuyển sang các giải pháp thay thế tương đương như DeepSeek V4.1 Flash và Qwen 3.8 Flash, vốn có sẵn tại các trung tâm dữ liệu ở châu Âu.

Cách thức hoạt động

Thí nghiệm dựa vào các công cụ giám sát như AgentsView để theo dõi phân bố token, chi phí và mức tiêu thụ năng lượng trên các mô hình khác nhau. Quy trình làm việc bao gồm việc sử dụng trợ lý AI cho nhiều tác vụ khác nhau, bao gồm triển khai giao diện người dùng (UI), viết tài liệu và chạy đánh giá trên mã nguồn Wagtail. Mô hình được chọn, GLM 5.3 Flash, cung cửa sổ ngữ cảnh 1 triệu token và hỗ trợ thị giác, cho phép nó xử lý ảnh chụp màn hình và đảm nhiệm các phiên lập trình kéo dài.

Một phần đáng kể của sự hao hụt tài nguyên đến từ việc "vibe coding" (lập trình theo cảm hứng) một máy chủ Model Context Protocol (MCP) thử nghiệm. Phương pháp này ưu tiên tốc độ tạo nguyên mẫu hơn là cấu trúc mã tối ưu. Nhà phát triển đã chọn một cấu hình mô hình không tối ưu cho nguyên mẫu này, dẫn đến sự gia tăng đột biến lên tới 450 triệu token, tốn 150 USD và tiêu thụ 5 kWh năng lượng chỉ trong một đêm. Mặc dù nguyên mẫu hoạt động đúng chức năng, nó đã làm nổi bật cách mà các mẫu hành vi tự động (agentic patterns) và việc lựa chọn mô hình kém có thể làm phình to chi phí đáng kể so với các phương pháp kỹ thuật thận trọng hơn.

Chi tiết chính

  • Tổng mức tiêu thụ: Thí nghiệm đã xử lý 2 tỷ token trong tháng 9 năm 2026.
  • Tuân thủ ngân sách: Nửa đầu tháng nằm trong ngân sách 68 USD, nhưng tổng cả tháng đã vượt quá các mục tiêu hiệu quả ban đầu.
  • Tác động năng lượng: Tổng mức sử dụng năng lượng đạt khoảng 35 kWh, cao hơn đáng kể so với mức dự kiến 10 kWh cho một quy trình làm việc thuần túy hiệu quả.
  • Giới hạn hạ tầng: Sự suy giảm hiệu suất trên GLM 5.3 Flash đã buộc phải chuyển sang DeepSeek V4.1 Flash và Qwen 3.8 Flash.
  • Chi phí nguyên mẫu: Một nguyên mẫu máy chủ MCP duy nhất đã tiêu thụ 450 triệu token và 150 USD qua đêm do việc lựa chọn mô hình kém hiệu quả.
  • Khả năng của mô hình: GLM 5.3 Flash được khen ngợi nhờ cửa sổ ngữ cảnh 1M, hỗ trợ thị giác và khả năng tiếp cận đa nhà cung cấp.

Tại sao điều này quan trọng

Đối với các nhóm phần mềm áp dụng phát triển hỗ trợ bởi AI, nghiên cứu tình huống này nhấn mạnh sự khác biệt giữa hiệu quả lý thuyết và thực tế vận hành. Mặc dù các mô hình dòng flash (flash-tier) có tính kinh tế cao cho các tác vụ thường nhật, chúng không miễn nhiễm với các ràng buộc chuỗi cung ứng. Việc phụ thuộc vào một mô hình hoặc nhà cung cấp duy nhất tạo ra một điểm lỗi đơn lẻ khi nhu cầu tăng vọt. Các kỹ sư cần nhận ra rằng các mô hình "mã nguồn mở" vẫn phụ thuộc vào hạ tầng vật lý, thứ có thể bị hạn chế so với các ông lớn độc quyền.

Hơn nữa, sự phân biệt giữa lập trình sản xuất và nghiên cứu & phát triển (R&D) là rất quan trọng đối với việc lập ngân sách. Công việc thử nghiệm, đặc biệt khi sử dụng các quy trình làm việc tự động hoặc kỹ thuật tạo nguyên mẫu nhanh, tiêu thụ tài nguyên với tốc độ cao hơn nhiều. Nếu không có ngân sách riêng và hệ thống giám sát cho R&D, những thí nghiệm này có thể phá vỡ các sáng kiến tiết kiệm chi phí. Các nhóm cần đo lường thành công không chỉ bằng số token được tạo ra, mà còn bằng năng lượng sử dụng và kết quả cụ thể đạt được.

Bạn có thể làm gì

  • Triển khai các công cụ đo lường mức sử dụng cục bộ để theo dõi token, mức tiêu thụ năng lượng và chi tiêu theo thời gian thực.
  • Tạo ngân sách riêng cho các tác vụ kỹ thuật hàng ngày và các dự án R&D thử nghiệm.
  • Đảm bảo hạ tầng đủ linh hoạt để chuyển đổi giữa các mô hình khi gặp vấn đề về khả năng sẵn có hoặc hiệu suất.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết