Trong bài viết
Tóm tắt nhanh
OpenAI hiện công bố mức giá API Standard mới cho GPT-5.6 Terra và GPT-5.6 Luna. So với bảng giá ở giai đoạn preview, Terra giảm 20% và Luna giảm 80% cho cả input lẫn output token.
| Model | Input / 1M tokens | Cached input / 1M | Output / 1M tokens |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $0.50 | $30.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
| GPT-5.5 | $5.00 | $0.50 | $30.00 |
Bảng trên là giá Standard, short context. Với long context, Terra là $4 input / $18 output và Luna là $0.40 input / $1.80 output trên 1M tokens.
Đây là thay đổi có ý nghĩa với các đội ngũ đang đưa AI Agent vào production: Terra giờ rẻ hơn GPT-5.5 khoảng 60%, còn Luna rẻ hơn khoảng 96% nếu so cùng đơn giá input hoặc output.
Không chỉ là “giảm giá model”
Ở bản preview, OpenAI từng công bố Terra ở mức $2.50 input / $15 output và Luna ở mức $1 input / $6 output trên 1M tokens. Bảng pricing API hiện tại cho thấy:
| Model | Giá preview | Giá Standard hiện tại | Mức giảm |
|---|---|---|---|
| Terra – input | $2.50 | $2.00 | 20% |
| Terra – output | $15.00 | $12.00 | 20% |
| Luna – input | $1.00 | $0.20 | 80% |
| Luna – output | $6.00 | $1.20 | 80% |
Tín hiệu chiến lược nằm ở cost-performance: OpenAI đang làm Luna trở thành lựa chọn cực rẻ cho workload có volume lớn; Terra là lớp cân bằng cho daily agent work; Sol dành cho reasoning khó và escalation.
Nếu tất cả task đều đi qua model flagship, sản phẩm sẽ sớm có một tính năng mới: real-time invoice streaming.
Chọn model theo workflow, không chọn theo cảm xúc
Luna: high-volume, deterministic work
Dùng Luna cho các tác vụ có cấu trúc rõ, cần tốc độ và volume:
- Classification, intent routing, tagging.
- Trích xuất dữ liệu theo JSON schema.
- Chuẩn hoá nội dung, tóm tắt ngắn, tạo bản nháp.
- FAQ first-pass và pre-processing trước khi escalated.
Với giá $0.20 input và $1.20 output trên 1M tokens, Luna phù hợp để giảm chi phí ở “tầng đáy” — nơi số lượt gọi thường tăng nhanh nhất khi hệ thống scale.
Terra: worker agent cho công việc hằng ngày
Terra phù hợp cho workflow cần chất lượng reasoning/coding tốt hơn nhưng chưa cần flagship:
- Phân tích tài liệu, viết technical content, code review.
- Agent xử lý ticket, lập kế hoạch tác vụ nhiều bước.
- Tạo đề xuất, so sánh phương án, hỗ trợ vận hành nội bộ.
Ở mức $2 input / $12 output trên 1M tokens, Terra rẻ hơn 60% so với GPT-5.5 hoặc Sol, nhưng vẫn là lựa chọn cần được đánh giá trên dataset thực tế của doanh nghiệp.
Sol: chỉ dùng khi escalation có giá trị
Sol phù hợp cho reasoning khó, long-horizon agentic work và final decision support có kiểm soát. Đắt hơn không phải là vấn đề; dùng Sol cho mọi việc mới là vấn đề.
Cost model: chênh lệch thực tế lớn hơn bạn nghĩ
Giả sử một workflow xử lý 10.000 yêu cầu/tháng; mỗi yêu cầu dùng trung bình 2.000 input tokens và 500 output tokens.
| Model | Chi phí ước tính/tháng |
|---|---|
| Luna | $10 |
| Terra | $100 |
| Sol | $250 |
Cách tính:
- Tổng input: 20M tokens/tháng.
- Tổng output: 5M tokens/tháng.
- Ví dụ Luna: 20 × $0.20 + 5 × $1.20 = $10.
Con số trên chưa bao gồm long context, tool calls, retry hay reasoning tokens. Nhưng nó đủ để cho thấy model routing có thể tạo chênh lệch chi phí 25× giữa Luna và Sol trong cùng workload giả định.
Prompt caching: đòn bẩy FinOps cần đo được
Bảng giá hiện tại cũng tách riêng cached input và cache writes:
- Terra: cached input $0.20, cache write $2.50 / 1M tokens.
- Luna: cached input $0.02, cache write $0.25 / 1M tokens.
- Sol: cached input $0.50, cache write $6.25 / 1M tokens.
Với system prompt dài, tool schema lặp lại hoặc context chung giữa nhiều request, cache-hit rate cần là một metric trong observability dashboard — cùng với token usage, latency, retry rate và outcome.
Khuyến nghị triển khai
Luna → classify / extract / route / draft
Terra → analyse / code / daily multi-step work
Sol → complex reasoning / high-risk escalation / final decision support
Đừng routing bằng cảm tính. Hãy thiết kế policy có thể đo:
- Xác định task classes và SLO chất lượng.
- Đặt token budget, retry cap và ngưỡng escalation cho từng class.
- Theo dõi chi phí theo workflow và business outcome, không chỉ theo model.
- Đánh giá định kỳ trên test set nội bộ trước khi đổi default model.
Kết luận
Việc điều chỉnh giá Terra và đặc biệt là Luna khiến kiến trúc multi-model trở nên thực tế hơn cho đội ngũ xây AI Agent. Lợi thế không nằm ở chỗ dùng model rẻ nhất; nó nằm ở việc dùng đúng model cho đúng unit of work, rồi kiểm soát chi phí bằng routing, caching và observability.


