AI

Testování malých modelů

Daniel Čupak•3 min. read•Mar 27, 2026
1_pA3u0In17udj3F6QJBDycQ.webp

aneb jak fungují na mém starém Macu M1 8GB RAM

Vývoj jazykových modelů je dechberoucí, ale kromě velkých jazykových modelů na cloudech máme nyní možnost provozovat menší modely i “u sebe”. Spojení “u sebe” berte prosím s rezervou, protože pro kvalitní reasoning modely jde stále o velké HW požadavky.

Jiná situace je u routování, resp. v agentních systémech, kde “velké přemýšlení” není potřeba — ba naopak — stačí jen rozhodnout mezi nástroji (tools) který vybrat, nebo jen shrnout výstup.

Test č. 1: Správné volání bez překlepů a chyb

Všechny úkoly jsou stejné — 150 zavolání lokálního modelu za sebou. V našem případě testuji “What is the weather like today in Berlin?” a očekávaný výsledek je výběr toolu na zjištění počasí přes API — navíc ještě správného toolu pro zjištění aktuálního počasí konkrétně v Berlíně.

Sledované metriky jsou průměrná latence, zvolení toolu, správné vybrání toolu a správně vybrané město (“Berlin”)

Pokud jde o správnost výběru nástroje a města jsou výsledky prvního testu, až na llama3.2:1b a qwen2.5:x, více méně stejné. Rozdíl je především v latenci, resp. rychlosti odpovědí modelů.

Test č. 2: Volání s drobnou chybou

V tomto případě testuji “What is the weather like today in berlín?”, resp. změní se jen “Berlin” na “berlín”, ale očekávaný výsledek je stále výběr toolu pro zjištění aktuálního počasí v Berlíně.

Press enter or click to view image in full size

V tomto testu už je situace zajímavější — z původní top 4 nám zůstala jen functiongemma a ministral-3:3b, přičemž 100 % úspěšnost mají jen tyto dva modely.

Test č.3: Multijazyčné volání s chybou

Prompt “Wat is počasí like today in berlin?” modelům překvapivě nedal zabrat víc než předchozí verze promptu a top 3 doplnil ještě granite4:350m.

Poznámka: Qwen 3 a novější je “thinking”, což značně zvyšuje latenci a pro volání nástrojů ani není potřeba. Po přidání parameteru payload[“think”] = False se např. u Qwen 3.5:0.8b snížila latence ze 4,5 na 1,6 s, ale na výstupy z Qwenu se budu muset ještě podívat.

Závěr

Přestože se v žádném případě (zatím) nejedná o nějaký vědecký test, ale spíš průzkum možností, vychází mi z těchto testů jako zajimavý model functiongemma, ministral-3 a granite4. Na tyto (a nejen na ně) se v dohledné budoucnosti zaměřím.

Kontaktujte nás

Máte zájem o spolupráci? Spojíme se s vámi.

Napište nám

Spojte se s námi napřímo

Jiří Mach

Jiří Mach

CEO & CSO