Modele AI

Qwen 3.8 Max z pierwszymi benchmarkami. Alibaba wyprzedza Fable 5 w kodowaniu i ucina cenę API o połowę

Alibaba opublikowało wyniki testów swojego największego modelu: 2,4 bln parametrów, lepszy od Claude Fable 5 w zadaniach programistycznych i cena API na poziomie 40 centów za milion tokenów wejściowych.

Alibaba dotrzymało obietnicy z początku lipca i opublikowało pełne benchmarki Qwen 3.8 Max — swojego największego modelu o 2,4 biliona parametrów. Podczas zapowiedzi firma deklarowała pozycję „drugiego po Fable 5“, ale nie pokazała żadnych liczb. Teraz twierdzi, że w części testów jej model jest lepszy od flagowca Anthropic.

Według opublikowanej karty modelu Qwen 3.8 Max zdobywa 87,2 proc. w SWE-bench Verified — o 1,4 punktu procentowego więcej niż wynik Fable 5 podawany przez Anthropic — oraz 92 proc. w teście matematycznym AIME 2026. W benchmarkach wiedzy ogólnej, w tym GPQA Diamond, model Anthropic pozostaje z przodu. Alibaba podkreśla też wyniki w zadaniach wielojęzycznych, gdzie model trenowano na korpusie obejmującym 119 języków.

Cena jako główny argument

Równie istotna co wyniki jest taryfa. Wejściowe tokeny w API kosztują 0,40 dol. za milion, wyjściowe 1,60 dol. — to mniej więcej połowa stawek za Claude Sonnet 5 i kilkukrotnie mniej niż za modele klasy Fable. Model jest dostępny od dziś w chmurze Alibaba oraz przez platformy partnerskie, w tym w regionach europejskich.

W przeciwieństwie do mniejszych modeli z rodziny Qwen, wersja Max nie dostaje otwartych wag. Alibaba publikuje jednocześnie Qwen 3.8 Medium — model o 110 mld parametrów z otwartymi wagami na licencji Apache 2.0, który w wewnętrznych testach firmy ma dorównywać zeszłorocznemu Qwen 3 Max.

Presja na czołówkę rośnie

Premiera wpisuje się w coraz ostrzejszą konkurencję ze strony chińskich laboratoriów. Moonshot AI po sukcesie Kimi K3 wstrzymało nowe subskrypcje z powodu braku mocy obliczeniowych, a DeepSeek zapowiada kolejną generację na jesień. Dla klientów korporacyjnych w Europie i Azji argument jest prosty: zbliżoną jakość można dziś kupić za ułamek ceny amerykańskich modeli.

Niezależne testy będą kluczowe. Wewnętrzne benchmarki producentów bywają dobierane pod publikowany wynik — pierwsze wyniki Qwen 3.8 Max w publicznych rankingach, w tym LMArena, powinny pojawić się w ciągu kilku dni.

Źródło: Alibaba Cloud

Komentarze

Dołącz do dyskusji

Komentarze są moderowane przed publikacją.