Writer "giải cứu" doanh nghiệp khỏi cơn sốt chi phí AI đắt đỏ

11:23, 14/08/2026

Trên toàn ngành công nghiệp AI, người dùng đang ngày càng nhận thức rõ chi phí triển khai có thể đắt đỏ đến mức nào và cảm thấy áp lực cấp thiết trong việc cắt giảm ngân sách. Mặc dù các mô hình mã nguồn mở (open source) mang lại chi phí trên mỗi token thấp hơn đáng kể, việc tìm kiếm mô hình phù hợp cho một công việc cụ thể vẫn là một bài toán hóc húa.

Nguồn ảnh: M. Reinerston/The Photo Group / Flickr theo giấy phép CC BY 2.0. 

Vào thứ Năm, Writer - công ty chuyên cung cấp các công cụ và agent AI cho ngành marketing đã trình làng mô hình chủ lực mới mang tên Palmyra X6, nhằm giải quyết bài toán nói trên cho khách hàng. Được xây dựng dựa trên biến thể hậu huấn luyện (post-training) từ mô hình mã nguồn mở GLM-5.2 của Z.ai, Writer khẳng định hệ thống mới sẽ mang lại khả năng sẵn sàng triển khai với mức chi phí rẻ hơn nhiều. Công ty ước tính mô hình mới, khi kết hợp với những cải tiến trong hạ tầng harness, sẽ giúp khách hàng cắt giảm chi phí lên tới 50% đối với các tác vụ cơ bản.

Cùng với mô hình mới, công ty cũng tung ra những bản nâng cấp quan trọng cho hệ thống agentic harness tiêu chuẩn của mình. Cả hai tính năng này sẽ chính thức khả dụng cho các khách hàng của Writer kể từ thứ Năm.
"Tôi nghĩ các doanh nghiệp đã quá mệt mỏi với việc chạy theo hết điểm số benchmark này đến điểm số benchmark khác," Giám đốc điều hành (CEO) May Habib chia sẻ với TechCrunch. "Họ muốn chi phí được bình ổn, nhưng dường như chưa bên nào làm được điều đó."
Phương pháp tiếp cận mới đặc biệt chú trọng vào các tác vụ phức tạp, nhiều bước, được thực thi nhanh hơn và tiêu tốn ít token hơn. Trong đó, Writer coi việc tối ưu hóa hệ thống harness là đòn bẩy then chốt để hiện thực hóa điều này.

Một báo cáo gần đây từ các nhà nghiên cứu của Writer đã củng cố tính đúng đắn cho phương pháp này, thông qua việc thử nghiệm những thay đổi nhỏ về hiệu suất harness trên nhiều mô hình khác nhau. Kết quả nghiên cứu cho thấy, trong nhiều trường hợp, việc tinh chỉnh harness mang lại hiệu quả giảm chi phí đáng tin cậy hơn so với việc lựa chọn mô hình, với mức chi phí giảm trung bình 40% trong các đợt thử nghiệm.
"Harness là thành phần duy nhất mà hiệu suất của nó sẽ nhân lên trên mọi mô hình mà một tổ chức vận hành cả ở hiện tại lẫn trong tương lai," các nhà nghiên cứu viết trong báo cáo.
Đối với khách hàng của Writer, trải nghiệm sử dụng vẫn đảm bảo tính linh hoạt, không phụ thuộc vào một mô hình cố định (model-agnostic): Palmyra X6 sẽ vận hành song song với các mô hình khác của Writer hoặc các mô hình bên ngoài được tích hợp qua Azure hay Amazon Bedrock. Tuy nhiên, bà Habib cũng nhận thấy áp lực cắt giảm chi phí đang làm gia tăng sự hoài nghi đối với các phòng thí nghiệm AI lớn, những đơn vị vốn có động cơ tài chính trong việc thúc đẩy gia tăng lượng token tiêu thụ.

"Sự bùng nổ về chi phí hiện nay là điều chưa từng có đối với khách hàng, và mức độ quay lưng của các Giám đốc Công nghệ (CIO) đối với các phòng thí nghiệm AI cũng vậy," bà Habib chia sẻ với TechCrunch, đồng thời nói thêm rằng các phòng thí nghiệm AI "chưa thực sự hiểu sâu sắc cách giúp một doanh nghiệp gặt hái được giá trị thực sự từ AI."