Set `serviceTier` in `providerOptions.gateway` to route requests between `default`, `priority` (~1.8-2x cost), or `flex` (~0.5x cost) tiers; billing auto-adjusts based on actual tier used.
Summary
Developers can now optimize request handling without code restructuring—interactive endpoints get priority queuing while background jobs use cheaper capacity. Tier configuration is unified across OpenAI, Gemini, and other providers, reducing boilerplate.
Why it matters
Developers can now optimize request handling without code restructuring—interactive endpoints get priority queuing while background jobs use cheaper capacity. Tier configuration is unified across OpenAI, Gemini, and other providers, reducing boilerplate.
Implementation verdict
This replaces manual provider-specific configuration for throughput/latency tuning. Requires single line addition to `providerOptions` in AI SDK or compatible APIs. Production-ready now; best-effort fallback to default tier on capacity constraints means no failure risk. Worth testing immediately if you have mixed latency requirements.
Sources
Dev Signal
Get briefs like this in your inbox — free, every weekday.
100+ sources compressed into one 4-minute read. Ranked, cited, implementation-ready.