Red Hat AI 3.5 se soustředí na bezpečnost a monitoring firemní umělé inteligence
Společnost Red Hat představila řešení Red Hat AI ve verzi 3.5. Novinka poskytuje škálovatelný základ pro správu, zabezpečení a monitoring pracovních AI zátěží napříč hybridním cloudem a překlenuje tak mezeru mezi izolovanými piloty a plně spravovanou podnikovou architekturou.
Zásadní aktualizace v portfoliu Red Hat AI přináší ověřitelnou důvěryhodnost, provozní kontrolu, standardizované architektury a transparentní přehled o výkonu – tedy klíčové předpoklady pro provozování AI jako sdílené podnikové služby.
Co je Red Hat AI 3.5?
Red Hat AI 3.5 představuje provozní rámec, který organizace vyžadují pro produkční škálování AI a její bezpečné rozšiřování napříč hybridními prostředími. Platforma umožňuje validaci modelů ještě před jejich nasazením díky nástroji EvalHub, který nabízí bezpečnostní benchmarking zaměřený na rizika a automatické generování podkladů pro audit a regulatorní shodu (regulatory compliance). Nové dashboardy pro monitoring (observability) poskytují v reálném čase komplexní metriky o zdraví inferenčních procesů, vytížení GPU i celkovém výkonu modelů. Běžní uživatelé bez administrátorských práv získávají přístup k dashboardům pro sledování spotřeby tokenů na uživatele (showback) a pro distribuované inferenční úlohy.
Red Hat AI 3.5 dále rozšiřuje enterprise funkce a přináší pokročilou multitenanci pro poskytovatele AI služeb a scénáře vyžadující striktní izolaci od hardwaru až po softwarový stack. Současně nabízí priority-aware serving s nativní multitenancí pro efektivní sdílení GPU infrastruktury. Organizacím vyžadujícím maximální oddělení jednotlivých tenantů nabízí Red Hat AI oficiální podporu provozu na hostovaných řídicích rovinách (Hosted Control Planes) v Red Hat OpenShift nad Red Hat OpenShift Virtualization. Hosted Control Planes garantují každému tenantu vyhrazenou řídicí rovinu (control plane) clusteru při zachování konsolidace podkladového hardwaru. Spuštění AI workloadů ve virtuálních strojích (VM) přes Red Hat OpenShift Virtualization zajišťuje robustní izolaci na úrovni hypervizoru v rámci sdílené GPU infrastruktury. Všechny tyto funkce dohromady umožňují správcům spravovat a aktualizovat celou infrastrukturu z jednoho centrálního místa.
Red Hat AI 3.5 rovněž usnadňuje vývoj a nasazení autonomních AI agentů. Nástroj AutoRAG propojuje podniková datová úložiště s agentními aplikacemi a přináší funkce jako multilingvální podporu dokumentů, konverzační testování a kontextové vyhledávání. Vizuální pipeline umožňuje vývojovým týmům ověřit konfiguraci RAG ještě před ostrým nasazením. Šablony agentů nabízejí předkonfigurované referenční implementace pro běžné enterprise use case-y, například code review, zpracování dokumentů nebo výzkumné workflows (research workflows). V produkčním provozu pak technologie Inference-Time Scaling (ITS) optimalizuje náklady na GPU dynamickou alokací výpočetního výkonu podle náročnosti dotazu.
Proč zvolit Red Hat AI 3.5?
Jakmile pilotní projekty potvrdí svou přidanou hodnotu a návratnost investic, IT týmy čelí úkolu překlopit tyto AI služby do celopodnikového měřítka. Škálování AI napříč organizací však vyžaduje plnění nároků kladených na kritickou infrastrukturu: ověřenou bezpečnost před nasazením, precizní řízení zdrojů ve sdílených GPU prostředích, kontrolované chování agentů a transparentní metering. Většina firem se v současnosti potýká s roztříštěnými nástroji a neefektivními manuálními postupy. Red Hat AI 3.5 tento stav řeší konsolidací bezpečnosti, multitenance, vývoje agentů a monitoringu do jediné ucelené enterprise platformy. Výsledkem je AI fungující jako řízená a odpovědná architektura napříč hybridním cloudem – nikoli jako izolovaný experiment.
Klíčové funkce Red Hat AI 3.5
- Ověřitelná bezpečnost před nasazením a evaluace: Modely v katalogu obsahují integrovaná skóre benchmarku Garak, zatímco všeobecná dostupnost (General Availability – GA) nástroje EvalHub automatizuje reporting bezpečnosti a auditovatelné shody pro vlastní modely, RAG a AI agenty.
- Správa GPU pro multi-tenant inferenci: Fair-share GPU scheduling zajišťuje spravedlivou alokaci zdrojů mezi tenanty. Priority-aware serving poskytuje řízení přístupu a směrování požadavků podle priorit, čímž chrání reálný čas inferenčních úloh a umožňuje úlohám na pozadí využívat volnou kapacitu GPU.
- API pro agenty a zabezpečení přes gateway: Všeobecně dostupná podpora Responses API a integrovaného RAG nabízí jednotné open-source rozhraní pro vícekrokové konverzace agentů, chráněné bezpečnostními mantinely NeMo Guardrails proti škodlivým aktivitám.
- Ukotvení podnikových dat a efektivní reasoning: AutoRAG s podporou pgvector, nativní AutoML a Inference-Time Scaling (ITS) umožňují modelům dynamicky škálovat výpočetní výkon podle složitosti dotazu.
- Integrovaný monitoring a showback pro MaaS (Model-as-a-Service): Poskytuje sledování spotřeby tokenů na uživatele, výkonnostní dashboardy pro modely a agenty, vizuální trasování přes MLflow a metriky vytížení GPU pro kompletní provozní transparentnost.
- Předpřipravené šablony agentů pro zrychlení vývoje: AI Hub přináší šablony a starter kity s předkonfigurovanými referenčními architekturami pro běžné enterprise use case-y (kontrola kódu, zpracování dokumentů, výzkumné workflows).
Podrobný přehled novinek
- Podpora Hosted Control Planes a OpenShift Virtualization: Red Hat AI oficiálně podporuje Hosted Control Planes, což každému tenantu garantuje vyhrazenou řídicí rovinu a současně zvyšuje efektivitu využití hardwaru. Provoz AI workloadů ve virtuálních strojích (VM) nad OpenShift Virtualization umožňuje bezpečné sdílení fyzických serverů s robustní izolací.
- Rozšířená nabídka validovaných modelů s hodnocením bezpečnosti: Do katalogu přibylo přes 20 nových validovaných modelů (např. Google Gemma 4, NVIDIA Nemotron 3, Alibaba Cloud Qwen). Modely disponují kompletním benchmarkingem výkonu a nově zahrnují hodnocení bezpečnosti podle metodiky Garak, vyhodnocení rizik úniku PII (osobních údajů) a měření toxicity.
- Modelová validace pro tool calling: Vybrané modely v katalogu nesou certifikaci pro volání nástrojů (tool calling), což usnadňuje volbu modelů pro agentní scénáře.
- Řízení provozu a bezpečné aktualizace modelů: Priority-aware serving spravuje přístup a směrování požadavků podle priorit k ochraně reálného času inferencí, zatímco úlohy na pozadí využívají volnou kapacitu. Funkce Controlled Model Rollout zajišťuje plynulý přechod mezi verzemi modelů bez výpadku služeb.
- Optimalizace správy GPU paměti: Všeobecná dostupnost (GA) CPU offloadingu a Developer Preview storage offloadingu umožňují zpracování dlouhých konverzací a rozsáhlých dokumentů bez nutnosti dokupování GPU hardwaru.
- Multimodální obsluha (multimodal serving): Unifikovaná vrstva založená na vLLM Omni (dostupná v režimu Early Access) umožňuje současnou obsluhu generování textu, zvuku a obrazu.
- Multi-cloud Kubernetes serving: Rozšiřuje distribuovanou inferenci llm-d mimo OpenShift i na ostatní Kubernetes platformy. Nyní je všeobecně dostupná (GA) na CoreWeave CKS a Microsoft Azure, přičemž Amazon EKS je dostupný v režimu Technology Preview.
- Developer kity pro AI agenty: AI Hub obsahuje šablony a starter kity pro vývoj agentů. Kity obsahují frameworky a konfigurace pro spouštění v sandboxu při plném zachování bezpečnostních politik od vývoje po produkci.
- Datové prostředí pro enterprise (Enterprise Data Workbench): Kubeflow Spark Operator (v režimu Developer Preview) přináší distribuované zpracování dat přímo do pracovního prostředí a sjednocuje přípravu dat s obsluhou modelů.
- GPU-as-a-Service a multitenance: Nabízí izolaci jmenných prostorů (namespace isolation), podporu Hosted Control Planes a dashboardy pro inventář hardwaru, reálné využití a dynamické zapůjčování GPU kapacity.
Dostupnost
Red Hat AI 3.5 je již aktuálně dostupný. K dispozici je také jako součást Red Hat AI Factory s NVIDIA.