Nowy model kodowy Microsoftu dla GitHub Copilot jest tańszy niż poprzednik, ale wciąż droższy i słabszy od Deepseek-V4-Flash-0731 w benchmarkach.

Źródło zdjęcia: The Decoder
Microsoft opublikował nową wersję modelu kodowego dla GitHub Copilot, MAI Code 1.1 Flash, reklamując go jako tańszy i skuteczniejszy niż poprzednik. Jak zauważa the-decoder.com, model wprawdzie poprawia wyniki względem czerwcowej edycji, ale w bezpośrednim porównaniu z konkurencyjnym Deepseek-V4-Flash-0731 przegrywa i pod względem ceny, i wydajności.
Microsoft porównał MAI Code 1.1 Flash z poprzednikiem oraz z modelami Haiku 4.5 od Anthropic i GPT-5.4 mini od OpenAI. W teście SWE-bench Verified nowy model uzyskał 72,6 procent, wyprzedzając MAI-Code-1-Flash (71,6 procent), Haiku 4.5 (69,8 procent) oraz GPT-5.4 mini (69,2 procent) — Deepseek nie opublikował w tym benchmarku swojego wyniku.
Zupełnie inaczej wygląda sytuacja w Terminal Bench 2.1. MAI Code 1.1 Flash osiągnął tam 62,9 procent, co jest lepsze niż wynik poprzednika (51,7 procent), Haiku 4.5 (49,4 procent) i zbliżone do GPT-5.4 mini (60,7 procent). Jednak Deepseek-V4-Flash-0731 zdystansował wszystkie te modele, notując aż 82,7 procent.
Zdaniem the-decoder.com te rozbieżności mogą wyjaśniać, czemu Microsoft w oficjalnym ogłoszeniu unika bezpośrednich porównań z konkurencją i ukrywa pełne wyniki benchmarków w karcie modelu, ograniczając się do niejasnych metryk poprawy — takich jak wzrost „przetrwania kodu” o 4 procent i wzrost liczby powracających użytkowników o 9 procent względem poprzednika.
Choć MAI Code 1.1 Flash na papierze wygląda jak model budżetowy, w praktyce jest wyraźnie droższy od Deepseek przy jednoczesnej niższej skuteczności. Porównanie cen za milion tokenów pokazuje skalę różnicy: Deepseek-V4-Flash kosztuje 0,14 dolara za wejście (0,0028 dolara z cache) i 0,28 dolara za wyjście. MAI Code 1.1 Flash to odpowiednio 0,20 dolara, 0,02 dolara i 1,20 dolara. Dla porównania Claude Haiku 4.5 wycenia te same parametry na 1,00 dolara, 0,10 dolara i 5,00 dolarów.
Autor artykułu zaznacza, że sam koszt za token nie mówi wszystkiego bez uwzględnienia efektywności wykorzystania modelu, jednak przewaga Deepseek jest prawdopodobnie znacząca niezależnie od metody liczenia.
Strategia Microsoftu kontrastuje z jego niedawnymi deklaracjami o wspieraniu otwartej sztucznej inteligencji. Zamiast korzystać z bardziej wydajnych i swobodnie dostępnych alternatyw, takich jak Deepseek-V4-Flash, firma inwestuje zasoby we własny, słabszy i droższy model o zamkniętym kodzie, który najprawdopodobniej nigdy nie zostanie udostępniony jako model o otwartych wagach.
Powodem może być ta sama logika, która stoi za niedawną przebudową Copilota — Microsoft zastąpił tam modele OpenAI i Anthropic własnymi, tańszymi rozwiązaniami MAI, godząc się na słabszą wydajność w zamian za lepsze marże. MAI Code 1.1 Flash wpisuje się w ten sam wzorzec: klienci w ekosystemie Microsoftu mogą wciąż wybierać różne modele zależnie od aplikacji i zastosowania, ale firma prawdopodobnie ostatecznie ustawi własne modele jako domyślne. To samo w sobie mogłoby zapewnić Microsoftowi ogromny udział w rynku, ponieważ większość użytkowników i tak nigdy nie wybiera aktywnie konkretnego modelu AI.
Sytuacja MAI Code 1.1 Flash pokazuje, że mimo publicznych deklaracji otwartości, komercyjne decyzje Microsoftu w praktyce idą w stronę kontroli nad własnym stosem technologicznym — nawet jeśli oznacza to gorsze parametry techniczne dla użytkowników GitHub Copilot.

Deepseek wypuszcza mocniejszy model V4-Pro, otwiera kod agenta Harness i podnosi ceny API przed planowanym IPO.

Zhipu AI publikuje GLM-5.3 – model kodujący z otwartymi wagami, który wykrył ponad 2400 podatności bezpieczeństwa w projektach open source.

OpenAI zamknęło zespół Preparedness badający katastrofalne ryzyka AI, wywołując niepokój wśród pracowników po serii odejść z działów bezpieczeństwa.