AI mở & chạy cục bộ

Mistral AI ra mắt mô hình 1 nghìn tỷ tham số với quy trình huấn luyện hiệu quả

Phòng thí nghiệm Pháp Mistral AI đã ra mắt Mistral Large 4, một mô hình đa phương thức có 1 nghìn tỷ tham số được huấn luyện trên 4.000 GPU, với kế hoạch phát hành trọng số mở trong ba tuần tới.

Một khối kính với mạch điện phát sáng bên cạnh các ghi chú kỹ thuật và một con chip.
Minh họa được tạo riêng cho bài viết này

Được dịch tự động từ bản gốc tiếng Anh.

Phòng thí nghiệm AI của Pháp Mistral AI vừa chính thức phát hành Mistral Large 4 (ML4), một mô hình đa phương thức lớn mới được thiết kế để cạnh tranh với các đối thủ từ Mỹ và Trung Quốc. Việc ra mắt diễn ra vào thứ Ba, đánh dấu một bước tiến quan trọng trong chiến lược của công ty nhằm cung cấp một lựa chọn thay thế châu Âu trong cuộc đua trí tuệ nhân tạo toàn cầu.

Chuyện gì đã xảy ra

Mô hình mới, được đặt biệt danh nội bộ là Le Chonk do quy mô khổng lồ lên tới 1 nghìn tỷ tham số, đại diện cho sự mở rộng đáng kể về năng lực của Mistral. Khác với các phiên bản nhỏ hơn trước đây, bản phát hành này nhắm đến ranh giới của các mô hình ngôn ngữ lớn, hướng tới việc mang lại hiệu suất ngang ngửa hoặc vượt trội so với các sản phẩm mã nguồn đóng hiện tại từ những ông lớn công nghệ. Công ty định vị ML4 như một phần của "con đường thứ ba" trong phát triển AI, khác biệt hoàn toàn với hệ sinh thái khép kín của các công ty Mỹ và các mô hình trọng số mở chủ yếu xuất hiện từ Trung Quốc.

Hiện tại, ML4 chưa sẵn sàng để tải xuống dưới dạng trọng số mở ngay lập tức. Thay vào đó, nó có thể truy cập qua một endpoint có rào chắn bảo vệ công khai trong khi công ty hoàn tất các bài kiểm tra an toàn cần thiết. Mistral đã thông báo rằng toàn bộ trọng số của mô hình sẽ được phát hành trong ba tuần, sau khi hoàn thành các đợt kiểm toán bảo mật. Cách tiếp cận theo giai đoạn này cho phép đội ngũ hợp tác với các đối tác tin cậy và cơ quan chính phủ để đảm bảo công nghệ đủ vững chắc trước các hành vi sử dụng độc hại trước khi phân phối rộng rãi.

Pierre Stock, Phó Chủ tịch phụ trách Khoa học tại Mistral, nhấn mạnh rằng sự chậm trễ này là có chủ đích nhằm giải quyết những lo ngại ngày càng tăng về bảo mật từ phía khách hàng doanh nghiệp và tổ chức. Bằng cách kiểm soát quyền truy cập ban đầu, công ty aims cân bằng giữa lợi ích minh bạch của trọng số mở với nhu cầu triển khai có trách nhiệm. Stock lưu ý rằng các mô hình trọng số mở vốn dễ dàng kiểm toán hơn, điều này phù hợp với nhu cầu của nhóm khách hàng cốt lõi của họ, những người yêu cầu các tiêu chuẩn bảo mật có thể xác minh được.

Cách hoạt động

Một đặc điểm nổi bật của ML4 là hiệu quả huấn luyện. Mô hình được huấn luyện hoàn toàn trên hạ tầng tính toán riêng của Mistral, chỉ sử dụng 4.000 GPU Nvidia. Theo Stock, lượng phần cứng này nhỏ hơn hai đến ba lần so với mức mà các đối thủ Trung Quốc sử dụng và ít hơn đáng kể so với những gì các đối thủ mã nguồn đóng thường dùng cho các mô hình cùng quy mô. Điều này cho thấy mức độ tối ưu hóa cao trong quy trình huấn luyện, giúp Mistral đạt được kết quả cạnh tranh với ít tài nguyên hơn.

Mô hình này là đa phương thức, nghĩa là nó có thể xử lý và tạo ra nhiều loại dữ liệu khác nhau, chẳng hạn như văn bản và hình ảnh, mang lại giá trị trong các quy trình kỹ thuật phức tạp. Mistral tập trung huấn luyện vào các lĩnh vực cụ thể có giá trị cao nơi những khả năng này trở nên then chốt. Công ty nhấn mạnh an ninh mạng, tài chính và thiết kế chip là các trường hợp sử dụng được tối ưu hóa chính. Sự chuyên môn hóa này được hỗ trợ bởi sự hậu thuẫn chiến lược từ các nhà lãnh đạo ngành như ASML và Samsung, những đơn vị đã đầu tư mạnh mẽ vào sự tăng trưởng của Mistral và dựa vào AI tiên tiến cho chính quy trình sản xuất bán dẫn của họ.

Chi tiết chính

  • Mistral Large 4 chứa 1 nghìn tỷ tham số, nhờ đó nó có biệt danh Le Chonk.
  • Mô hình được huấn luyện chỉ bằng 4.000 GPU Nvidia, một phần nhỏ so với sức mạnh tính toán mà các đối thủ sử dụng.
  • Trọng số mở sẽ được phát hành trong ba tuần sau khi hoàn tất kiểm tra an toàn và hợp tác với chính phủ.
  • Quyền truy cập hiện tại bị giới hạn ở một endpoint có rào chắn bảo vệ công khai để ngăn chặn việc sử dụng độc hại trong giai đoạn kiểm toán.
  • Các trường hợp sử dụng được tối ưu hóa bao gồm an ninh mạng, tài chính và thiết kế chip, phản ánh mối quan tâm của các nhà đầu tư như ASML và Samsung.
  • Mistral hướng tới mục tiêu đưa ML4 trở thành mô hình tốt nhất trong số các mô hình trọng số mở trên toàn cầu, đặc biệt là bên ngoài Trung Quốc.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm và lãnh đạo kỹ thuật, việc phát hành ML4 báo hiệu sự chuyển dịch sang các mô hình nền tảng hiệu quả hơn và chuyên biệt hơn. Khả năng huấn luyện một mô hình 1 nghìn tỷ tham số trên một cụm GPU tương đối khiêm tốn chứng minh rằng sức mạnh tính toán thô không phải là con đường duy nhất để đạt hiệu suất đỉnh cao. Hiệu quả này có thể hạ thấp rào cản cho các doanh nghiệp muốn tinh chỉnh hoặc triển khai các mô hình lớn mà không cần phụ thuộc hoàn toàn vào các nhà cung cấp hạ tầng đám mây đắt đỏ nhất.

Việc phát hành trọng số mở theo giai đoạn cũng giải quyết một căng thẳng then chốt trong cộng đồng AI: mong muốn về tính minh bạch so với rủi ro lạm dụng. Bằng cách ưu tiên kiểm toán bảo mật và hợp tác với chính phủ trước khi phát hành trọng số, Mistral đang thiết lập một tiền lệ cho sự phát triển mã nguồn mở có trách nhiệm. Cách tiếp cận này có thể hấp dẫn các ngành chịu sự quản lý chặt chẽ như tài chính và y tế, nơi khả năng kiểm toán và an toàn là những yêu cầu không thể thương lượng khi áp dụng các công nghệ AI mới.

Hơn nữa, sự tập trung vào thiết kế chip và an ninh mạng đưa ML4 phù hợp với các lĩnh vực công nghệ phần cứng ngày càng phụ thuộc vào AI cho đổi mới sáng tạo. Đối với các nhà phát triển làm việc trong những lĩnh vực này, việc sở hữu một mô hình được tối ưu hóa riêng cho miền ứng dụng của họ có thể giảm bớt nhu cầu huấn luyện tùy chỉnh mở rộng, đẩy nhanh chu kỳ phát triển sản phẩm. Sự hậu thuẫn từ các ông lớn phần cứng như ASML và Samsung càng khẳng định tiềm năng ứng dụng thực tế của mô hình trong các quy trình công nghiệp.

Bạn có thể làm gì

  • Theo dõi endpoint có rào chắn bảo vệ công khai để thử nghiệm các khả năng đa phương thức của ML4 trong lĩnh vực cụ thể của bạn.
  • Chuẩn bị hạ tầng cho đợt phát hành trọng số mở trong ba tuần tới bằng cách đánh giá các yêu cầu về lưu trữ và tính toán.
  • Xem xét lại các giao thức bảo mật AI hiện tại của bạn để phù hợp với các tiêu chuẩn kiểm toán mà Mistral đang áp dụng cho ML4.
  • Khám phá các trường hợp sử dụng trong an ninh mạng, tài chính hoặc thiết kế chip, nơi đầu vào đa phương thức có thể nâng cao các quy trình làm việc hiện có.
  • Tương tác với hệ sinh thái đối tác của Mistral để hiểu cách các tổ chức tin cậy đang tích hợp mô hình một cách an toàn.
  • Cập nhật kết quả benchmark khi chúng được công bố để so sánh hiệu suất của ML4 với các mô hình trọng số mở khác.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết