Anthropic đã ra mắt Claude Sonnet 5.5 vào ngày 28/09 với mức giá như Sonnet 5. Theo công ty, mẫu AI này hoạt động nhanh hơn hơn 30% và chi phí thấp hơn tối đa 30% cho mỗi nhiệm vụ.
Một công ty kiểm định độc lập lại có kết luận khác về chi phí khi thử đẩy hiệu suất mẫu AI này lên mức tối đa.
Theo dõi chúng tôi trên X để nhận tin tức mới nhất ngay khi vừa có
Anthropic giới thiệu mẫu 5.5 thứ hai chỉ sau vài ngày ra mắt Opus
Sonnet 5.5 là mẫu AI thứ hai trong dòng Claude 5.5. Anthropic đã ra mắt Opus 5.5 vào ngày 22/09. Cùng ngày đó, OpenAI cũng chính thức trình làng GPT-6 Sol và Luna.
Mẫu AI mới vẫn giữ mức giá của Sonnet 5, là 2 USD cho mỗi triệu input token và 10 USD cho mỗi triệu output token. Theo Anthropic, Sonnet 5.5 đạt điểm 70.6% trên bài kiểm tra Terminal-Bench 4.0, đây là bài đánh giá năng lực lập trình. Sonnet 5 chỉ đạt 10.3%, trong khi Opus 5.5 đạt 66.4%.
“Nếu Opus 5.5 được thiết kế cho công việc phức tạp cần đánh giá kỹ, thì Sonnet 5.5 phù hợp nhất với các tác vụ hàng ngày, sửa lỗi nhanh và tạo tài liệu, slide, hay bảng tính chỉn chu,” đội ngũ bình luận.
Anthropic cho biết Sonnet 5.5 không mở rộng biên giới về khả năng của dòng Claude. Vì vậy, việc kiểm tra độ an toàn tập trung vào các rủi ro như gây hiểu lầm cho người dùng hoặc bị lợi dụng cho những mục đích lớn và nguy hiểm.
Sonnet 5.5 còn được tích hợp các bộ lọc bảo mật mạng và bộ nhận diện chống sao chép nhằm ngăn chặn việc trích xuất suy luận của mô hình để huấn luyện cho các hệ thống cạnh tranh. Trong vài tuần tới, Claude Haiku 5.5 cũng sẽ được trình làng.
Trong khi đó, OpenAI đã hoãn ra mắt mẫu GPT-6.1 Astra vì lý do an toàn. CNBC xác nhận vào thứ Hai vừa qua rằng mẫu này chưa đáp ứng được chuẩn của công ty.
Artificial Analysis phát hiện Sonnet 5.5 tiêu tốn token nhiều hơn khi làm việc hết công suất
Artificial Analysis, đơn vị kiểm định từng xếp Grok 4.7 ở vị trí thứ tư, đã cho Sonnet 5.5 56 điểm trên Chỉ số Thông minh của họ. Con số này đặt Sonnet 5.5 ở vị trí thứ hai, kém Opus 5.5 hai điểm khi chạy hết mức tối đa.
Đơn vị này ghi nhận Sonnet 5.5 đạt 64% trên bài test Terminal-Bench 4.0, so với 60% ở Opus 5.5 và GPT-6 Astra. Ở các bài kiểm tra dạng kiến thức như GDPval-AA, Sonnet 5.5 có hiệu suất gần bằng Opus 5.5.
Theo họ, Sonnet 5.5 dùng số lượng token đáng kể hơn để đạt kết quả như trên.
“Khi hoạt động hết công suất, đạt hiệu suất gần bằng Opus 5.5, Claude Sonnet 5.5 sử dụng khoảng 193,000 Output token cho mỗi tác vụ của Chỉ số Thông minh,” đơn vị này chia sẻ.
Số lượng này cao hơn khoảng 60% so với Opus 5.5 và Sonnet 5 ở mức tối đa. Thậm chí còn gấp khoảng 7 lần so với GPT-6 Astra khi làm việc hết công suất.
Tuy nhiên, theo chia sẻ các khách hàng dùng thử sớm từ Anthropic, Sonnet 5.5 lại tiêu tốn ít token hơn Sonnet 5 ở các nhiệm vụ khác nhau. Đơn cử, Balyasny Asset Management cho biết lượng token cần thiết cho các tác vụ tài chính giảm hẳn.
“Trong bộ 2,441 tác vụ tài chính riêng tư gồm hỏi đáp, trích xuất, phân tích và dự báo, Claude Sonnet 5.5 không chỉ vượt điểm Sonnet 5 mà còn chỉ dùng khoảng 121,000 token mỗi câu trả lời, trong khi Sonnet 5 cần đến 497,000,” Joe Poirier, Kỹ sư AI cao cấp tại Balyasny Asset Management chia sẻ.
Artificial Analysis đã thử nghiệm bản tiền phát hành của Sonnet 5.5 có lỗi xuất dữ liệu cấu trúc mà Anthropic đã khắc phục. Đơn vị này sẽ tiến hành đánh giá lại trong thời gian tới.
Đăng ký kênh YouTube của chúng tôi để xem các chuyên gia và nhà báo nhận định sâu sắc về lĩnh vực này









