Skip to content

AI Providers

Výběr významných služeb pro inference open-weight modelů (Llama, Qwen, Gemma, DeepSeek, gpt-oss). Přímý host provozuje modely; gateway sjednocuje API a směruje požadavky k dalším poskytovatelům. Některé služby nabízejí i proprietární modely.

Ověřeno k 9. 10. 2026. U tokenových cen je pořadí vstup/výstup za 1M tokenů v USD. Katalogy i ceny se mění; OpenAI-kompatibilní API obvykle znamená Chat Completions, nikoli automaticky podporu všech funkcí OpenAI API.

Host open-weight modelů s důrazem na produkční provoz a evropskou infrastrukturu.

  • OpenAI-kompatibilní API, serverless a batch inference, dedikované endpointy a fine-tuning.
  • Nabízí zero-retention inference v EU i USA. Pro data residency je potřeba vybrat odpovídající endpoint.
  • Ceník, zdroj: funkce a EU/US inference.

Široký katalog open-weight modelů a zázemí pro fine-tuning i dedikovaný provoz.

  • Serverless API, dedikované GPU endpointy a fine-tuning; textové, obrazové i další modely.
  • OpenAI-kompatibilní API pro snadné přepnutí klienta.
  • Llama 3.3 70B: $1.04/$1.04 podle ceníku; cenu vždy vztáhnout ke konkrétní variantě modelu a režimu služby.

Produkční inference open-weight modelů s optimalizovaným servingem a návazností na trénování.

  • Široký katalog včetně Qwen, DeepSeek, Kimi a Llama; text i vision.
  • Serverless, on-demand a rezervovaná kapacita; fine-tuning a nasazení upravených modelů na stejné platformě.
  • OpenAI i Anthropic-kompatibilní API. Zdroj: inference a nabídka nasazení.

Univerzální inference platforma pro open-weight modely a více modalit.

Inference na specializovaných LPU akcelerátorech, zaměřená na rychlé generování odpovědí.

Inference na wafer-scale hardwaru, také zaměřená na rychlé generování.

  • Kandidát pro coding, reasoning a agentní aplikace citlivé na dobu generování.
  • OpenAI-kompatibilní rozhraní a dedikovaná inference s rezervovanou kapacitou.
  • Výběr podmínit dostupností konkrétního modelu, limity a cenou. Zdroj: dokumentace a aktuální nabídka.

Spravovaná inference integrovaná s ekosystémem Cloudflare Workers.

  • Praktická volba pro aplikace ve Workers; OpenAI-kompatibilní endpointy.
  • 10 000 Neuronů/den zdarma, nad limit $0.011 / 1 000 Neuronů na Workers Paid; některé modely vyžadují placenou metodu účtování.
  • Llama 3.3 70B fp8-fast: $0.293/$2.253 — u dlouhých výstupů sledovat hlavně výstupní sazbu. Zdroj: ceník.

Spravovaná inference v DigitalOcean s vlastním hostingem i přístupem k modelům třetích stran.

  • OpenAI-kompatibilní API; katalog zahrnuje Llama, DeepSeek, Qwen a Kimi i proprietární modely.
  • Serverless se účtuje podle tokenů a vyžaduje předplacený zůstatek; dedikovaná inference podle GPU hodin.
  • Praktická volba pro aplikace již provozované v DigitalOcean. Zdroj: serverless vs. dedicated, ceník.

Jedno API pro open-weight i proprietární modely od mnoha poskytovatelů.

  • Sjednocené účtování, směrování a fallback při nedostupnosti poskytovatele.
  • Lze určit povolené poskytovatele, pořadí a požadavky na práci s daty; data residency posuzovat pro skutečného hosta i gateway.
  • Cenu modelu a poplatky za kredity či BYOK ověřovat odděleně. Zdroj: provider routing, ceny a plány. Viz též AI Tools.

Gateway s jednotným klíčem, účtováním a přehledem spotřeby; přirozená integrace s Vercel AI SDK.

  • Podporuje OpenAI Chat Completions, Responses i Anthropic Messages; automatický fallback a řízení poskytovatelů.
  • Tokeny za ceníkovou cenu poskytovatele bez přirážky, včetně BYOK v placeném režimu. Některé doplňkové funkce a zpracování plateb mohou mít další poplatky.
  • Free tier: $5 měsíčně pro vybrané modely; po zakoupení kreditů přechází účet na placený režim a měsíční free kredit končí. Zdroj: ceník.

Agregátor inference poskytovatelů propojený s Hugging Face Hubem.

  • Jedno rozhraní a účtování; volba konkrétního poskytovatele nebo politiky :fastest, :cheapest, :preferred.
  • Bez dodatečné přirážky k sazbám poskytovatele. OpenAI-kompatibilní router je určen pro chat completions; jiné úlohy používají HF klienty.
  • Pro vlastní dedikované nasazení existuje samostatná služba Inference Endpoints. Zdroj: Inference Providers.

Významné zejména při existující cloudové infrastruktuře, požadavcích na správu přístupů a regionální nasazení. Dostupnost modelů, API i cena závisejí na regionu a typu deploymentu.

  • Široký katalog a vlastní fine-tuning: Together, Fireworks, Nebius.
  • Rychlé interaktivní generování: porovnat Groq a Cerebras na konkrétním modelu a úloze.
  • Více poskytovatelů přes jedno API: OpenRouter, Vercel AI Gateway, Hugging Face.
  • Existující infrastruktura: Workers AI pro Cloudflare, DigitalOcean Inference pro DigitalOcean; Bedrock, Foundry nebo Google Cloud pro příslušný cloud.
  • EU data residency: ověřit endpoint, skutečný region zpracování, retention a chování fallbacků. Nabídka EU regionu sama o sobě nestačí.

Pro porovnání ceny a výkonu použít také Artificial Analysis, ale konečnou cenu, SLA a dostupnost regionů ověřit u poskytovatele pro konkrétní model a tarif.