Mistral uvádí Large 4, svůj zatím nejvýkonnější model s otevřenými váhami

Sdílet

Ilustrační obrázek vytvořený prostřednictvím chatbota LeChat firmy Mistral. Prompt: "ilustrační obrázek umělá inteligence mistral"
Autor: Lupa.cz, s využitím AI LeChat
Ilustrační obrázek vytvořený prostřednictvím chatbota LeChat firmy Mistral. Prompt: "ilustrační obrázek umělá inteligence mistral"
Francouzská společnost Mistral AI zpřístupnila veřejný náhled modelu Mistral Large 4, interně označovaného jako „le Chonk“. Jde o model s jedním bilionem parametrů, z nichž je aktivních 49 miliard, a podle firmy o nejvýkonnější model, jaký kdy Mistral vytvořil. Model se zároveň řadí mezi nejsilnější open-weight modely na světě. Veřejný náhled je dostupný přes API na platformě Mistral Studio, samotné váhy modelu firma zveřejní koncem měsíce.

Mistral Large 4 je nativně multimodální model, který podle Mistralu dosahuje výkonu srovnatelného s nejsilnějšími open-source modely na světě a překonává jakýkoli jiný otevřený model vyvinutý v USA nebo Evropě. Na kritických firemních úlohách v kybernetické bezpečnosti, financích a právu jde podle firmy o nejlepší výsledky mezi otevřenými modely. Ve vizuálním porozumění (visual grounding) model překonává i uzavřené modely nejvyšší třídy.

Do konce měsíce Mistral model prověřuje formou red-teamingu v reálných podmínkách, a to ve spolupráci s lídry kybernetické bezpečnosti, prověřenými partnery a státními institucemi. Tito partneři pracují se stejným modelem s omezenou moderací a rozšířenými kybernetickými schopnostmi.

Data pod tlakem regulace: Jak firmy získávají kontrolu nad citlivými informacemi, v podcastu s Petrem Kunstátem
Data pod tlakem regulace: Jak firmy získávají kontrolu nad citlivými informacemi, v podcastu s Petrem Kunstátem
0:00/

Evropská infrastruktura jako základ datové suverenity

Model vznikl od základu na 3 800 GPU NVIDIA Grace Blackwell ve vlastních evropských datacentrech Mistralu a stejná infrastruktura pohání i veřejný náhled. Firma to popisuje jako důležitý bod dlouhodobé investice do infrastruktury, výzkumu a vývoje produktů: špičkový výkon v kritických oblastech doplněný otevřenými váhami, které dávají zákazníkům kontrolu nad vlastní AI.

Tento přístup má podle Mistralu zvláštní význam v kybernetické bezpečnosti. Odmítání požadavků na úrovni poskytovatele může blokovat legitimní výzkum zranitelností a reakci na incidenty, a ztráta přístupu ke schopnostem modelu uprostřed incidentu může sama představovat bezpečnostní riziko. Mistral Large 4 kombinuje výkon v kybernetické bezpečnosti s otevřenými váhami a možností vlastního nasazení, takže organizace získávají jak schopnosti, tak autonomii provádět pokročilou bezpečnostní práci podle vlastních pravidel.

Model bude dostupný ve více regionech po celém světě, včetně evropského nasazení, které Mistral provozuje nezávisle na jiných poskytovatelích digitálních služeb a v souladu s evropským právem. Významná část trénovacích dat byla vícejazyčná a pokrývala více než 160 jazyků, včetně všech úředních jazyků Evropské unie. Na vývoji modelu Mistral spolupracoval s podniky z oborů financí, strojírenství, výroby, logistiky, farmacie, vědy, lodní dopravy i veřejného sektoru. Model využívá stejné prostředí pro trénování, přizpůsobení a posilované učení, jaké Mistral nabízí zákazníkům prostřednictvím platformy Mistral Forge.

Postkvantová kryptografie a datová suverenita s Petrem Kunstátem
Postkvantová kryptografie a datová suverenita s Petrem Kunstátem
0:00/

Kybernetická bezpečnost mezi pěti nejlepšími modely na světě

Podle nezávislého hodnocení Artificial Analysis Cyber Index, které měří schopnost AI modelů najít a opravit bezpečnostní chyby v reálném softwaru, patří Mistral Large 4 mezi pět nejlepších modelů na světě a s výrazným náskokem vede mezi open-weight modely vyvinutými mimo Čínu. V jedné z úloh indexu, kde model reprodukuje reálnou zranitelnost v open-source softwaru a následně ji opraví, dosahuje 82 procent, což je nejvyšší skóre ze všech hodnocených modelů. V benchmarku Cybench, který obsahuje 40 úloh z bezpečnostních soutěží, vyřešil 93 procent zadání, což patří mezi nejvyšší hodnoty zaznamenané u open-weight modelu.

Toto skóre má podle Mistralu i praktický rozměr. Několik předních uzavřených modelů, včetně Claude Opus 5.5 a GPT-6 Astra, dosahuje ve stejném testu skóre blízké nule, protože úlohu odmítají provést. Obrana softwaru přitom často začíná právě prokázáním, že chyba existuje, tedy přesně tím typem práce, který bezpečnostní filtry uzavřených modelů blokují. Na významu to získává tím, že útočníci stále častěji obcházejí ochrany stejných modelů, aby je zneužili k útočné činnosti, a obránci proto potřebují systémy se srovnatelnými schopnostmi, které nejsou omezeny stejnými odmítnutími.

OpenAI a Anthropic zlevňují AI. Firmy už nehledají jen nejvýkonnější modely Přečtěte si také:

OpenAI a Anthropic zlevňují AI. Firmy už nehledají jen nejvýkonnější modely

Schopnosti modelu podle Mistralu přesahují rámec explicitního tréninku: v interních testech se osvědčil při analýze malwaru, prioritizaci zranitelností a tvorbě detekčních pravidel. Pro organizace, které potřebují suverénní a auditovatelnou AI pro bezpečnostní operace, bude model dostupný pro provoz v privátním cloudu nebo on-premise.

Agentní programování a pracovní postupy

Model vyniká v softwarovém inženýrství, porozumění repozitářům a složitých terminálových úlohách: dosahuje 61,7 procenta na DeepSWE v1.1, 59,4 procenta na SWE-Atlas-QnA a 28,3 procenta na Terminal-Bench 4. Souhrnné skóre Coding Agent Index 49,8 procenta jej řadí před modely DeepSeek V4 Pro 0813 a Qwen3.8 Max.

V slepém lidském hodnocení kvality kódu, které provedla společnost Surge AI, hodnotitelé posuzovali výstupy modelů na škále jedna až pět bez znalosti jejich identity. Mistral Large 4 skončil druhý z pěti modelů se skóre 3,74, před modely Kimi K3 (3,59), GLM-5.3 (3,60) a GLM-5.2 (3,40), za modelem Claude Opus 5 (4,22).

Automobilky čelí nejhoršímu scénáři: Jejich vozy se brzy nemusí připojit k internetu Přečtěte si také:

Automobilky čelí nejhoršímu scénáři: Jejich vozy se brzy nemusí připojit k internetu

Na benchmarku AutomationBench, který obsahuje 657 firemních pracovních postupů napříč aplikacemi jako Gmail, Google Sheets, Slack nebo Salesforce, dosahuje model 59,9 procenta a předbíhá tak Kimi K3, MiMo-V2.6-Pro i DeepSeek V4 Pro. Podobně silný výsledek vykazuje v produkci profesionálních výstupů, jako jsou tabulky, prezentace a PDF dokumenty. Na benchmarku AA-Briefcase, který hodnotí dlouhodobější znalostní práci, dosahuje 1 393 bodů Elo, před modelem DeepSeek V4 Pro.

Multimodální porozumění a vědecké aplikace

Mistral Large 4 představuje podle firmy výrazný posun ve schopnosti modelů rozumět obrazu. Dokáže analyzovat složité dokumenty, grafy i přirozené snímky a přináší vizuální schopnosti do oborů jako strojírenství, výroba nebo pozorování Země. Kombinuje přitom vizuální porozumění s agentními schopnostmi, od analýzy gigapixelových satelitních snímků, která pomáhá týmům krizového řízení v časově kritických situacích, až po kontrolu technických výkresů se zoomováním a ověřováním, dokud není odpověď přesná.

Na benchmarku Dense 200, zaměřeném na vizuální lokalizaci, model podle firmy překonává i GPT-6-Astra (42 procent oproti 41 procentům).

Google Workspace zapíná hlas, spouští Gmail Live, Keep Live a Docs Live Přečtěte si také:

Google Workspace zapíná hlas, spouští Gmail Live, Keep Live a Docs Live

Model disponuje také silnými vědeckými schopnostmi, vzniklými kombinací metod AI s expertízou výzkumníků Mistralu v matematice, fyzice a chemii. Jde podle firmy o nejlepší výsledek mezi open-weight modely na benchmarku SciCode-Verified, přičemž model dokáže na jeden pokus vygenerovat kompletní Hartree–Fockovu simulaci, komplexní vícekrokovou chemickou úlohu. V matematice model podle interních hodnocení uvažuje přesněji a strukturovaněji než GLM-5.3 a zvládá dlouhé, oborově specifické úlohy z aplikované matematiky, včetně prací relevantních pro teoretickou fyziku na hranici poznání.

Finance a právo

Model dosahuje podle Mistralu silných výsledků i na reálných profesních úlohách, jako je tvorba a úprava složitých tabulek a dokumentů. Prostřednictvím nezávislého hodnotitele vals.ai firma testovala model na reprezentativních právních a finančních úlohách a v obou případech zaznamenala lepší výsledek než u modelu GPT-6-Astra. Na benchmarku Legal Agent od HarveyAI model překonává všechny open-source modely.

Bezpečnost modelu

Mistral Large 4 podle firmy dosahuje nejlepších výsledků mezi open-source modely na interních benchmarcích odolnosti proti nepřímým prompt injection útokům, a to ve srovnání s modely GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3 a DS-V4-Pro-0813. Na veřejném benchmarku B3 AI Security od Lakery odolává 93,3 procentům útoků, což je nejvyšší zaznamenané skóre mezi konkurenčními modely.

Model se chová zodpovědněji vůči uživatelům než kterýkoli předchozí model Mistralu, se skóre 1,691 na KORA Benchmarku, kde maximum dva body odpovídá označení „vzorové“. Zvláštní pozornost firma věnuje sklonu modelu odmítat škodlivé požadavky týkající se kybernetické bezpečnosti: navzdory silnému výkonu na kybernetických benchmarcích je průměrná míra odmítnutí u kybernetických promptů z JailbreakBench, StrongREJECT a AgentHarm vyšší než u všech ostatních open-source modelů.

5G v kufru: privátní mobilní síť, kterou lze rozbalit v terénu za deset minut Přečtěte si také:

5G v kufru: privátní mobilní síť, kterou lze rozbalit v terénu za deset minut

V interním hodnocení, kde experti napříč programováním, CAD, financemi, matematikou a fyzikou porovnávali Mistral Large 4 s GLM-5.3, byl Mistral Large 4 preferován v CAD a STEM oblastech, zatímco ve financích a programování dosahoval srovnatelných nebo mírně slabších výsledků.

Posilované učení ve velkém měřítku

Firma zdůrazňuje roli posilovaného učení (reinforcement learning) při doškolování modelu. Jde o metodu, která se podle Mistralu přizpůsobuje tempu zlepšování samotného modelu, protože trénink probíhá na výsledcích vlastních pokusů modelu a obtížnost i šíři úloh lze postupně zvyšovat. Firemní knihovna pro posilované učení umožňuje kombinovat v jednom trénovacím běhu úlohy od jednoduchého chatu přes vědecké řešení problémů až po bezpečnostní zarovnání, faktickou přesnost a dlouhodobé použití nástrojů, se sdílenými nástroji jako kódové sandboxy, webové vyhledávání a externí API.

Při současném rozsahu 3 000 GPU generuje jeden trénovací běh přibližně 33 miliard tokenů denně, z čehož přibližně 16 miliard tvoří trénovatelné dokončovací tokeny po filtrování. Firma uvádí, že zlepšení pozorovaná při tréninku se přenášejí i do navazujících hodnocení, a to díky kombinaci obou fází doškolování, řízeného jemného ladění (supervised fine-tuning) i posilovaného učení.

Co bude dál

Mistral Large 4 je podle firmy prvním milníkem plánu financovaného z tří miliard eur kola Series D, největšího kapitálového kola, jaké kdy evropská technologická firma získala. Kapitál firma využívá na navyšování výpočetní kapacity ve vlastních evropských datacentrech, přičemž další kapacita přibude v nadcházejících měsících.

workshop ChatGPT

Trénovací běh posilovaného učení, který stojí za aktuálním náhledem, podle Mistralu stále probíhá a model nevykazuje známky nasycení. Firma proto očekává další zlepšení v následujících týdnech a měsících. Váhy modelu Mistral zveřejní do konce měsíce spolu s podrobnostmi o architektuře, dalšími benchmarky a metodikou doškolování. Mistral Large 4 má zároveň sloužit jako základ pro novou generaci specializovaných a optimalizovaných modelů Mistralu, přizpůsobených konkrétním odvětvím a úlohám zákazníků.

Cena modelu v rozhraní API činí jedna celá třicet šest setin dolaru za milion vstupních tokenů a čtyři celé osmnáct setin dolaru za milion výstupních tokenů.

Computertrends - promo

Computertrends si můžete objednat i jako klasický časopis. Je jediným odborným magazínem na českém a slovenském trhu zaměreným na profesionály v oblasti informačních a komunikačních technologií (ICT). Díky silnému zázemí přináší aktuální zpravodajství, analýzy, komentáře a přehledy nejnovejších technologií dříve a na vyšší odborné úrovni, než ostatní periodika na tuzemském trhu.

Obsah Computertrends je určen odborníkům a manažerům z firem a institucí, kteří se podílejí na rozhodovacím procesu při nákupu ICT technologií. Jednotlivá čísla si můžete objednat i v digitální podobě.