Giá model giảm có thể làm một kiến trúc trông rẻ hơn trên bảng tính, nhưng chưa cho biết workflow có tốn ít tiền hơn hay không. Một task thất bại rồi phải chạy lại, review lâu hoặc chuyển sang model khác vẫn tạo thêm chi phí mà giá token không thể hiện.
Quyết định cần tách khỏi headline
OpenAI công bố giảm giá GPT-5.6 Luna 80% và Terra 20%, đồng thời định giá Fast mode của Sol gấp đôi Standard để đổi lấy tốc độ tối đa 2,5 lần. Anthropic giới thiệu Claude Opus 5 như một lựa chọn gần frontier với chi phí khoảng một nửa Claude Fable 5.
Hai thông báo cho thấy model economics đang dịch chuyển nhanh. Chúng chưa chứng minh model nào rẻ hơn cho một quy trình cụ thể, vì số lần gọi, độ dài context, retry rate, thời gian review và chất lượng đầu ra vẫn khác nhau.
Khung kiểm tra thực dụng
Một bảng model routing nên ghi ít nhất:
- task và ngưỡng chất lượng cần đạt;
- latency từ lúc nhận input đến khi có output dùng được;
- tổng token, retry và bước review của con người;
- tỷ lệ phải chuyển sang model mạnh hơn;
- hậu quả nếu output sai hoặc không đầy đủ.
Model nhỏ có thể phù hợp cho phân loại hoặc chuyển đổi định dạng. Bước có quyết định khó, context dài hoặc chi phí sai cao có thể cần model khác. Routing tốt là phân bổ chất lượng đúng chỗ, không phải ép mọi bước vào mức giá thấp nhất.
Điều chưa được chứng minh
Các benchmark được dẫn đều do nhà phát hành công bố. Chúng hữu ích để lập shortlist, nhưng chưa thay thế blind test trên dữ liệu, prompt, tool và tiêu chí đánh giá của workflow thật.
Hành động tuần này
Chọn 20 task đại diện, chạy mù hai model với cùng input và rubric, rồi tính chi phí trên mỗi output đạt chuẩn. Chỉ đổi default sau khi quality, latency và review effort cùng được ghi lại.