Open weights tạo thêm quyền kiểm soát, nhưng cũng chuyển nhiều trách nhiệm về phía đội triển khai. Khi model lớn hơn hoặc context dài hơn, yêu cầu về phần cứng, serving, bảo mật dữ liệu và đánh giá chất lượng cũng tăng theo.

Hai tín hiệu đáng theo dõi

Thinking Machines Lab công bố Inkling-Small với kiến trúc MoE 276B tham số tổng, 12B active, context tối đa 1M token và reasoning cho audio lẫn image. LG AI Research công bố K-EXAONE 2.0 với 750B tham số, Apache 2.0 và hỗ trợ 10 ngôn ngữ, trong đó có tiếng Việt.

Những thông số này giúp xác định model đáng thử. Chúng chưa trả lời model cần bao nhiêu VRAM ở cấu hình thực tế, throughput ra sao, chất lượng tiếng Việt ổn định đến mức nào hoặc tổng chi phí serving có phù hợp không.

Cổng đánh giá trước khi tải weights

Một thử nghiệm có trách nhiệm nên khóa trước:

  • license, quyền phân phối và điều kiện sử dụng thương mại;
  • nguồn weights, checksum và cách cập nhật phiên bản;
  • VRAM, precision, quantization, latency và throughput mục tiêu;
  • bộ eval tiếng Việt theo đúng domain và failure mode;
  • ranh giới dữ liệu, logging và quy trình xóa artifact nhạy cảm.

Thử nghiệm đầu tiên nên chạy offline với dữ liệu không nhạy cảm. Chỉ sau khi chất lượng và footprint đủ rõ mới nên bàn đến kết nối hệ thống thật.

Điều chưa được chứng minh

Các so sánh benchmark và hiệu suất/token hiện là claim của nhà phát hành. Apache 2.0 là tín hiệu license tích cực cho K-EXAONE, nhưng vẫn không thay thế review model card, dependency và nghĩa vụ của sản phẩm downstream.

Hành động tuần này

Tạo một model intake sheet cho hai ứng viên: license, hardware, latency target, ba bộ eval tiếng Việt và tiêu chí dừng. Không tải weights vào môi trường có credential hoặc dữ liệu người dùng ở vòng đầu.

Nguồn đối chiếu