AI Providers
Výběr významných služeb pro inference open-weight modelů (Llama, Qwen, Gemma, DeepSeek, gpt-oss). Přímý host provozuje modely; gateway sjednocuje API a směruje požadavky k dalším poskytovatelům. Některé služby nabízejí i proprietární modely.
Ověřeno k 9. 10. 2026. U tokenových cen je pořadí vstup/výstup za 1M tokenů v USD. Katalogy i ceny se mění; OpenAI-kompatibilní API obvykle znamená Chat Completions, nikoli automaticky podporu všech funkcí OpenAI API.
Přímí poskytovatelé inference
Section titled “Přímí poskytovatelé inference”Host open-weight modelů s důrazem na produkční provoz a evropskou infrastrukturu.
- OpenAI-kompatibilní API, serverless a batch inference, dedikované endpointy a fine-tuning.
- Nabízí zero-retention inference v EU i USA. Pro data residency je potřeba vybrat odpovídající endpoint.
- Ceník, zdroj: funkce a EU/US inference.
Široký katalog open-weight modelů a zázemí pro fine-tuning i dedikovaný provoz.
- Serverless API, dedikované GPU endpointy a fine-tuning; textové, obrazové i další modely.
- OpenAI-kompatibilní API pro snadné přepnutí klienta.
- Llama 3.3 70B: $1.04/$1.04 podle ceníku; cenu vždy vztáhnout ke konkrétní variantě modelu a režimu služby.
Produkční inference open-weight modelů s optimalizovaným servingem a návazností na trénování.
- Široký katalog včetně Qwen, DeepSeek, Kimi a Llama; text i vision.
- Serverless, on-demand a rezervovaná kapacita; fine-tuning a nasazení upravených modelů na stejné platformě.
- OpenAI i Anthropic-kompatibilní API. Zdroj: inference a nabídka nasazení.
Univerzální inference platforma pro open-weight modely a více modalit.
- Vedle LLM nabízí embeddings, reranking, obrázky, video a audio; také privátní modely a GPU instance.
- OpenAI-kompatibilní Chat Completions, streaming, tool calling a structured outputs podle modelu.
- Kandidát při porovnávání nákladů napříč open-weight modely; sazby jsou v katalogu. Zdroj: přehled platformy.
Inference na specializovaných LPU akcelerátorech, zaměřená na rychlé generování odpovědí.
- Kandidát pro interaktivní chat, hlasové aplikace a agentní smyčky citlivé na rychlost odpovědi. Zdroj: LPU a modality.
- API je převážně OpenAI-kompatibilní, ale některé parametry nejsou podporované.
- Ověřit konkrétní modely a rate limits; rychlost hardwaru sama nezaručuje dostupnou kapacitu.
Inference na wafer-scale hardwaru, také zaměřená na rychlé generování.
- Kandidát pro coding, reasoning a agentní aplikace citlivé na dobu generování.
- OpenAI-kompatibilní rozhraní a dedikovaná inference s rezervovanou kapacitou.
- Výběr podmínit dostupností konkrétního modelu, limity a cenou. Zdroj: dokumentace a aktuální nabídka.
Spravovaná inference integrovaná s ekosystémem Cloudflare Workers.
- Praktická volba pro aplikace ve Workers; OpenAI-kompatibilní endpointy.
- 10 000 Neuronů/den zdarma, nad limit $0.011 / 1 000 Neuronů na Workers Paid; některé modely vyžadují placenou metodu účtování.
- Llama 3.3 70B
fp8-fast: $0.293/$2.253 — u dlouhých výstupů sledovat hlavně výstupní sazbu. Zdroj: ceník.
Spravovaná inference v DigitalOcean s vlastním hostingem i přístupem k modelům třetích stran.
- OpenAI-kompatibilní API; katalog zahrnuje Llama, DeepSeek, Qwen a Kimi i proprietární modely.
- Serverless se účtuje podle tokenů a vyžaduje předplacený zůstatek; dedikovaná inference podle GPU hodin.
- Praktická volba pro aplikace již provozované v DigitalOcean. Zdroj: serverless vs. dedicated, ceník.
API gatewaye a agregátory
Section titled “API gatewaye a agregátory”Jedno API pro open-weight i proprietární modely od mnoha poskytovatelů.
- Sjednocené účtování, směrování a fallback při nedostupnosti poskytovatele.
- Lze určit povolené poskytovatele, pořadí a požadavky na práci s daty; data residency posuzovat pro skutečného hosta i gateway.
- Cenu modelu a poplatky za kredity či BYOK ověřovat odděleně. Zdroj: provider routing, ceny a plány. Viz též AI Tools.
Gateway s jednotným klíčem, účtováním a přehledem spotřeby; přirozená integrace s Vercel AI SDK.
- Podporuje OpenAI Chat Completions, Responses i Anthropic Messages; automatický fallback a řízení poskytovatelů.
- Tokeny za ceníkovou cenu poskytovatele bez přirážky, včetně BYOK v placeném režimu. Některé doplňkové funkce a zpracování plateb mohou mít další poplatky.
- Free tier: $5 měsíčně pro vybrané modely; po zakoupení kreditů přechází účet na placený režim a měsíční free kredit končí. Zdroj: ceník.
Agregátor inference poskytovatelů propojený s Hugging Face Hubem.
- Jedno rozhraní a účtování; volba konkrétního poskytovatele nebo politiky
:fastest,:cheapest,:preferred. - Bez dodatečné přirážky k sazbám poskytovatele. OpenAI-kompatibilní router je určen pro chat completions; jiné úlohy používají HF klienty.
- Pro vlastní dedikované nasazení existuje samostatná služba Inference Endpoints. Zdroj: Inference Providers.
Velké cloudy
Section titled “Velké cloudy”Významné zejména při existující cloudové infrastruktuře, požadavcích na správu přístupů a regionální nasazení. Dostupnost modelů, API i cena závisejí na regionu a typu deploymentu.
- Amazon Bedrock — spravované open-weight i proprietární modely v AWS. Nabízí také OpenAI-kompatibilní endpointy; podporu modelu a API ověřit v tabulce dostupnosti endpointů.
- Microsoft Foundry / Azure — katalog modelů a spravované nasazení v Azure. OpenAI SDK podporuje také Foundry Models prodávané Azure přes Chat Completions; API se liší podle nabídky. Zdroj: SDK a endpointy.
- Google Cloud Model Garden — nabídka známá z Vertex AI, nyní v dokumentaci Gemini Enterprise Agent Platform. Spravované modely jako služba i vlastní nasazení open-weight modelů; u vlastního deploymentu se platí výpočetní prostředky. Zdroj: katalog a režimy nasazení.
Jak vybírat
Section titled “Jak vybírat”- Široký katalog a vlastní fine-tuning: Together, Fireworks, Nebius.
- Rychlé interaktivní generování: porovnat Groq a Cerebras na konkrétním modelu a úloze.
- Více poskytovatelů přes jedno API: OpenRouter, Vercel AI Gateway, Hugging Face.
- Existující infrastruktura: Workers AI pro Cloudflare, DigitalOcean Inference pro DigitalOcean; Bedrock, Foundry nebo Google Cloud pro příslušný cloud.
- EU data residency: ověřit endpoint, skutečný region zpracování, retention a chování fallbacků. Nabídka EU regionu sama o sobě nestačí.
Pro porovnání ceny a výkonu použít také Artificial Analysis, ale konečnou cenu, SLA a dostupnost regionů ověřit u poskytovatele pro konkrétní model a tarif.
