Tin AI

OpenAI ra mắt GPT-6.1 Sol với hiệu năng gần bằng Astra nhưng chi phí thấp hơn

OpenAI vừa trình làng GPT-6.1 Sol, một mô hình có khả năng tương đương với phiên bản chủ lực Astra trên các bài kiểm tra lập trình và sử dụng máy tính, trong khi chi phí mỗi token chỉ bằng một phần năm.

Được dịch tự động từ bản gốc tiếng Anh.

OpenAI đã phát hành GPT-6.1 Sol vào thứ Ba, chỉ một tuần sau khi giới thiệu GPT-6 Sol. Phiên bản mới này mang lại mức độ thông minh tương đương với mô hình cao cấp GPT-6 Astra cho các tác vụ lập trình tự động (agentic coding) và điều khiển máy tính, nhưng với mức giá giảm đáng kể. Bản cập nhật hiện đã khả dụng ngay lập tức qua API và dành cho người đăng ký gói ChatGPT Work và Codex.

Chuyện gì đã xảy ra

Điểm khác biệt chính của GPT-6.1 Sol là hiệu quả chi phí so với hiệu năng. OpenAI định vị mô hình này như một bản nâng cấp cho GPT-6 Sol tiêu chuẩn, tuyên bố rằng nó gần như sánh kịp khả năng của phiên bản chủ lực GPT-6 Astra trong công việc chuyên môn, tác nhân lập trình và tương tác máy tính. Quan trọng hơn, nó đạt được sự cân bằng này với mức giá chỉ bằng một phần năm so với giá token đầu vào và đầu ra tiêu chuẩn của Astra. Cấu trúc giá vẫn nhất quán với mô hình Sol trước đó: 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra. Token đầu vào được lưu trữ đệm (cached) được giảm giá mạnh xuống còn 0,10 USD cho mỗi triệu.

Quyền truy cập vào GPT-6.1 Sol khá rộng rãi nhưng cụ thể. Nó được tích hợp vào API và khả dụng cho người dùng Plus, Pro, Business, Enterprise và Edu trong môi trường ChatGPT Work và Codex. Tuy nhiên, nó chưa khả dụng trong giao diện Chat tiêu chuẩn. Một điểm bổ sung đáng chú ý cho các nhà phát triển sử dụng Codex là phiên bản "Ultrafast" của mô hình, cung cấp tốc độ tạo token nhanh gấp tám lần so với cấu hình tiêu chuẩn. Sự tăng tốc này nhắm vào các quy trình làm việc lập trình lặp đi lặp lại, nơi độ trễ ảnh hưởng trực tiếp đến năng suất của nhà phát triển.

Dữ liệu benchmark do OpenAI cung cấp nhấn mạnh những cải thiện đáng kể so với phiên bản tiền nhiệm ngay trước đó. Trên bài kiểm tra lập trình DeepSWE 1.1, GPT-6.1 Sol ghi điểm cao hơn GPT-6 Sol tới 6,4 điểm phần trăm. Kết quả này thực tế ngang bằng với GPT-6 Astra, bất chấp sự chênh lệch lớn về giá. Trong các tác vụ hiểu tài liệu, chẳng hạn như benchmark GDP.pdf kiểm tra khả năng trả lời câu hỏi trên các tệp PDF phức tạp, GPT-6.1 Sol đạt độ chính xác khoảng 32%. Con số này vượt qua Opus 5.5 của Anthropic (có cơ chế dự phòng), vốn chỉ đạt khoảng 29%, và một lần nữa phản ánh hiệu năng của Astra với chi phí vận hành chỉ bằng một phần nhỏ.

Cách thức hoạt động

GPT-6.1 Sol hoạt động như một phiên bản tinh chỉnh của kiến trúc Sol, được tối ưu hóa để liên kết tốt hơn và giảm tỷ lệ ảo giác mà không cần khối lượng tính toán khổng lồ của phân khúc Astra. Mô hình thể hiện độ tin cậy về mặt dữ kiện được cải thiện. Trong các thử nghiệm liên quan đến những cuộc hội thoại cố tình gây khó khăn, nơi người dùng đánh dấu các lỗi trước đó, tỷ lệ phản hồi chứa ít nhất một lỗi dữ kiện đã giảm từ 11,4% ở GPT-6 Sol xuống còn 7,7% ở GPT-6.1 Sol. Điều này đại diện cho mức giảm 32% lỗi dữ kiện ở các mức nỗ lực suy luận thấp.

Mô hình cũng tuân thủ nghiêm ngặt hơn các ràng buộc an toàn và ý định của người dùng. Trong thử nghiệm nội bộ, các tác nhân chạy trên GPT-6.1 Sol chỉ thất bại trong việc tiết lộ các công cụ tìm kiếm bị hỏng trong 2,1% trường hợp, ưu tiên sự minh bạch hơn là đoán mò. Hơn nữa, các tác nhân này không bao giờ cố gắng bỏ qua các trình xem xét an toàn tự động khi hành động của chúng bị chặn. Điều này cho thấy các quy trình học tăng cường hoặc tinh chỉnh cơ bản đã được điều chỉnh để ưu tiên sự liên kết vững chắc bên cạnh khả năng thô, đảm bảo rằng mô hình chi phí thấp vẫn an toàn cho việc triển khai doanh nghiệp.

Chi tiết chính

  • Giá cả: Token đầu vào có giá 2 USD mỗi triệu; token đầu ra có giá 10 USD mỗi triệu. Đầu vào được lưu trữ đệm có giá 0,10 USD mỗi triệu.
  • Hiệu năng: Ngang bằng với GPT-6 Astra trên các benchmark lập trình tự động và sử dụng máy tính với chi phí chỉ bằng một phần năm.
  • Khả năng truy cập: Có thể truy cập qua API, ChatGPT Work và Codex dành cho người dùng Plus, Pro, Business, Enterprise và Edu.
  • Tốc độ: Một phiên bản Ultrafast trong Codex cung cấp tốc độ tạo token nhanh gấp tới 8 lần.
  • Độ chính xác: Tỷ lệ lỗi dữ kiện giảm 32% so với GPT-6 Sol trong các bài kiểm tra hội thoại khó.
  • So sánh: Vượt trội hơn Opus 5.5 của Anthropic trên các benchmark GDP.pdf (32% so với 29%) và DeepSWE (75% so với 71%).

Tại sao điều này quan trọng

Đối với các trưởng nhóm kỹ thuật và nhà sáng lập công nghệ, việc phát hành GPT-6.1 Sol thay đổi bài toán kinh tế khi xây dựng các ứng dụng dựa trên AI. Trước đây, để đạt được hiệu năng tác nhân ở mức cao, các đội ngũ phải trả mức phí premium cho các mô hình chủ lực như Astra. Bây giờ, các đội ngũ có thể truy cập trí tuệ tương tự cho các tác nhân lập trình và tác vụ sử dụng máy tính với chi phí biên thấp hơn nhiều. Điều này giúp khả thi hóa việc mở rộng quy mô các trợ lý lập trình tự động, công cụ nội bộ và tự động hóa quy trình làm việc phức tạp mà không gặp phải hóa đơn token quá đắt đỏ. Sự sẵn có của biến thể Ultrafast trong Codex càng giảm bớt các khoản phạt về độ trễ, làm cho các công cụ hỗ trợ phát triển tương tác trở nên phản hồi nhanh hơn.

Sự cải thiện về độ chính xác dữ kiện và liên kết cũng cực kỳ quan trọng đối với các hệ thống sản xuất. Mức giảm 32% lỗi dữ kiện đồng nghĩa với việc dành ít thời gian hơn cho việc xác thực và gỡ lỗi sau khi tạo nội dung. Đối với các ứng dụng phụ thuộc vào việc trích xuất thông tin từ tài liệu hoặc thực hiện các tác vụ đa bước, xu hướng thừa nhận sự không chắc chắn thay vì đoán mò của mô hình làm giảm rủi ro thất bại ngầm. Độ tin cậy này cho phép các nhà phát triển tin tưởng giao phó cho mô hình những trách nhiệm tự chủ hơn, chẳng hạn như quản lý các công cụ tìm kiếm hoặc thực thi mã, với biết rằng các rào chắn an toàn được thực thi vững chắc hơn.

Bạn có thể làm gì

  • Đánh giá GPT-6.1 Sol cho các quy trình làm việc tác nhân lập trình hiện có của bạn để so sánh mức tiết kiệm chi phí so với GPT-6 Astra.
  • Kiểm tra phiên bản Ultrafast trong Codex để xác định xem mức tăng tốc 8 lần có cải thiện tốc độ phát triển của đội ngũ bạn hay không.
  • Xem xét lại logic xử lý lỗi của ứng dụng để tận dụng sự minh bạch được cải thiện của mô hình liên quan đến các công cụ bị hỏng.
  • Benchmark các đường ống xử lý tài liệu của bạn bằng chỉ số GDP.pdf để xem liệu GPT-6.1 Sol có cung cấp độ chính xác tốt hơn so với các nhà cung cấp hiện tại hay không.
  • Cập nhật dự báo ngân sách token của bạn, tính đến mức giá 0,10 USD mỗi triệu token cho đầu vào được lưu trữ đệm để tối ưu hóa chi phí.
  • Theo dõi việc triển khai trên Chat tiêu chuẩn, vì khả năng truy cập hiện tại chỉ giới hạn trong các môi trường Work và Codex.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết