Xây dựng mô hình AI tùy chỉnh với chi phí dưới 40 USD bằng các tác nhân tự động
Một kỹ sư đã sử dụng tác nhân ML Intern của Hugging Face để tinh chỉnh sáu mô hình chuyên biệt, bao gồm LoRA thị giác và trình viết lại được chưng cất (distilled), với tổng chi phí tính toán khoảng 103 USD.
Được dịch tự động từ bản gốc tiếng Anh.
Một nhà phát triển gần đây đã chứng minh cách tạo ra các mô hình AI chuyên biệt, có kích thước nhỏ gọn bằng cách sử dụng một tác nhân tự động tên là ML Intern. Trong vài ngày vào tháng 10 năm 2026, kỹ sư này đã xây dựng sáu mô hình riêng biệt, từ máy phát hiện bệnh cây trồng đến bộ tăng tốc tạo ảnh, với tổng chi phí tính toán khoảng 103 USD. Quy trình này dựa vào việc thiết kế prompt (câu lệnh) cẩn thận và kiểm soát ngân sách nghiêm ngặt trong hệ sinh thái Hugging Face.
Điều gì đã xảy ra
Dự án bắt đầu từ một nhu cầu cụ thể: một phiên bản nhẹ hơn của trình viết lại prompt được tích hợp trong Qwen-Image 2.1. Mô hình chính thức khá lớn, đòi hỏi khoảng 20 GB bộ nhớ và thời gian xử lý đáng kể. Các lựa chọn thay thế hiện có trên Hugging Face Hub chỉ đơn thuần là các phiên bản nén của cùng một mô hình nặng đó. Để giải quyết vấn đề này, nhà phát triển đã giao nhiệm vụ cho ML Intern, một tác nhân có sẵn trong HuggingChat, tạo ra một giải pháp thay thế nhỏ hơn và hiệu quả hơn. Tác nhân này đã sản xuất một mô hình 0,8 tỷ tham số chạy trên CPU, chỉ sử dụng một phần tư số token so với mô hình giáo viên (teacher model) và đạt đầu ra hợp lệ 99,7% thời gian. Toàn bộ quy trình, bao gồm cả việc gán nhãn dữ liệu bởi mô hình lớn hơn, chỉ tốn 16 USD.
Được khích lệ bởi kết quả này, nhà phát triển đã tạo thêm năm mô hình nữa sử dụng quy trình làm việc tương tự. Mỗi dự án bắt đầu như một cuộc trò chuyện trong HuggingChat với ML Intern được kích hoạt. Tác nhân đảm nhận việc lập kế hoạch, quản lý ngân sách, thử nghiệm, huấn luyện, đánh giá và công bố. Nó hoạt động trên phần cứng của Hugging Face, đảm bảo rằng mọi bước đều được theo dõi và chi phí được kiểm soát. Các mô hình kết quả được công khai với các chỉ số đánh giá chi tiết trong thẻ mô hình (model cards), thể hiện một quy trình lặp lại được cho việc phát triển AI tùy chỉnh.
Cách thức hoạt động
Cốt lõi của quy trình làm việc này là việc thiết kế prompt có cấu trúc. Nhà phát triển đã dành nhiều nỗ lực để hoàn thiện các hướng dẫn ban đầu, vốn phát triển từ 450 từ lên gần 2.000 từ qua sáu dự án. Mỗi prompt bắt đầu bằng một tuyên bố rõ ràng về mục tiêu và lý do. Sau đó, nó chỉ định tập dữ liệu, mô hình cơ sở và script huấn luyện. Quan trọng nhất, prompt bao gồm một phần được dán nhãn "Verified facts, do not re-derive" (Sự thật đã xác minh, không suy luận lại), liệt kê các ràng buộc và chi tiết kỹ thuật đã biết. Điều này ngăn chặn tác nhân lãng phí tài nguyên để khám phá lại những thông tin mà người dùng đã sở hữu, chẳng hạn như khả năng cụ thể của trainer hoặc các vấn đề đã biết với các công cụ dự phòng.
Hai hướng dẫn cụ thể rất quan trọng đối với thành công. Thứ nhất, prompt phải yêu cầu điểm hiệu suất cơ sở trước khi bất kỳ quá trình huấn luyện nào bắt đầu. Điều này cho phép so sánh rõ ràng để đo lường sự cải thiện. Thứ hai, nó yêu cầu một bài kiểm tra khói (smoke test)—một lần chạy thử nghiệm nhỏ, chi phí thấp—để xác minh rằng quy trình huấn luyện hoạt động trước khi cam kết thực hiện toàn bộ công việc. Ví dụ, tác nhân có thể chạy 50 bước huấn luyện và kiểm tra xem trọng số mô hình có thay đổi hay không. Cuối cùng, prompt đặt ra giới hạn chi tiêu cứng nhắc, chẳng hạn như 12 USD, và yêu cầu tác nhân xin phép trước khi vượt quá mức đó. Vì ML Intern bắt đầu với ngân sách 0 USD, cơ chế kiểm soát này đảm bảo chi phí vẫn dễ đoán.
Chi tiết chính
- Nhà phát triển đã xây dựng sáu mô hình, bao gồm máy phát hiện bệnh cây có múi, một LoRA đặc trưng cho nhân vật và một bộ tạo ảnh 4 bước.
- Tổng chi phí tính toán cho tất cả sáu dự án là khoảng 103 USD, với từng dự án dao động từ 1,90 USD đến 37 USD.
- ML Intern hoạt động trong HuggingChat và yêu cầu sự cho phép rõ ràng để chi tiền, bắt đầu với ngân sách 0 USD.
- Tác nhân tự động hóa việc tạo tập dữ liệu, huấn luyện, đánh giá và công bố lên Hugging Face Hub.
- Prompt bao gồm một phần "Verified facts" để ngăn chặn nghiên cứu dư thừa và thực thi các ràng buộc kỹ thuật.
- Các chỉ số cơ sở và bài kiểm tra khói là những thành phần bắt buộc trong prompt để đảm bảo chất lượng và hiệu quả chi phí.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm và chuyên gia học máy, phương pháp tiếp cận này hạ thấp rào cản trong việc tạo ra các mô hình tùy chỉnh. Theo truyền thống, việc tinh chỉnh (fine-tuning) đòi hỏi kiến thức sâu rộng về quản lý cơ sở hạ tầng, điều chỉnh siêu tham số và xây dựng đường ống dữ liệu. Bằng cách ủy quyền các nhiệm vụ này cho một tác nhân, các nhà phát triển có thể tập trung vào việc xác định vấn đề và chắt lọc dữ liệu. Khả năng tạo ra các mô hình chuyên biệt với chi phí dưới 40 USD giúp việc thử nghiệm trở nên dễ tiếp cận đối với cá nhân và các nhóm nhỏ không đủ khả năng chi trả cho các cụm GPU quy mô lớn.
Hơn nữa, sự nhấn mạnh vào các mô hình nhỏ, hiệu quả đáp ứng nhu cầu ngày càng tăng cho việc triển khai ở biên (edge deployment) và suy luận (inference) tiết kiệm chi phí. Trình viết lại 0,8 tỷ tham số, ví dụ, chạy trên CPU, khiến nó phù hợp cho các ứng dụng nơi độ trễ và ràng buộc phần cứng là yếu tố then chốt. Sự chuyển dịch này hướng tới việc chưng cất (distillation) và các LoRA chuyên biệt cho phép các nhà phát triển điều chỉnh khả năng AI cho các lĩnh vực cụ thể, chẳng hạn như nông nghiệp hoặc tạo ảnh đặc trưng thương hiệu, mà không cần phụ thuộc vào các mô hình nền tảng chung chung, ngốn nhiều tài nguyên.
Những gì bạn có thể làm
- Truy cập ML Intern qua HuggingChat và bật chế độ tác nhân để bắt đầu thử nghiệm với việc xây dựng mô hình tự động.
- Xem xét các prompt mẫu do nhà phát triển cung cấp trên GitHub tại yvrjsharma/ml-intern-prompts để hiểu cách cấu trúc hiệu quả.
- Bắt đầu với mức trần ngân sách nhỏ, chẳng hạn như 10 USD, để kiểm tra khả năng của tác nhân trên một nhiệm vụ đơn giản trước khi mở rộng quy mô.
- Bao gồm yêu cầu về các chỉ số cơ sở trong prompt của bạn để đảm bảo bạn có thể định lượng sự cải thiện của mô hình đã tinh chỉnh.
- Xác định một quy trình kiểm tra khói, chẳng hạn như một lần chạy huấn luyện ngắn, để xác minh đường ống trước khi cam kết huấn luyện ở quy mô đầy đủ.



