How do you estimate LLM API cost for a workload?
medium- _request × _request × × QPS × seconds.
- Input tokens are usually 3-5× cheaper than output.
- Watch out for: (1) system prompt + few-shot bloating input tokens; (2) unbounded on user side; (3) failed requests still charged in some APIs; (4) function-call round trips (each call is a request).
- Optimization levers: prompt caching (cache system prompt → discount on input), tighter , batching for embeddings.