Nowy model open-source Nvidia dorównuje OpenAI gpt-oss-120b przy ćwierci parametrów, osiągając 670 tokenów/s – najszybciej w klasie.

Źródło zdjęcia: The Decoder
Nvidia wprowadza nowy model open-source Nemotron 3.5 Lightning, który stawia na szybkość działania kosztem maksymalnej inteligencji. Model dorównuje pod względem wydajności 120-miliardowemu OpenAI gpt-oss-120b, używając jedynie ćwierci jego parametrów i osiągając najszybsze czasy inferencji w swojej klasie. Szczegóły prezentuje The Decoder.
Nemotron 3.5 Lightning to pierwszy model z nowej linii Nvidia Nemotron 3.5, będący bezpośrednim następcą modelu Nemotron 3 Nano 30B A3B. Zachowuje hybrydową architekturę Mamba-Transformer z 31,6 miliarda parametrów całkowitych, z których jedynie 3,6 miliarda jest aktywnych w danym momencie.
Według niezależnej platformy benchmarkowej Artificial Analysis, Nemotron 3.5 Lightning osiąga 24 punkty w Intelligence Index – to wzrost o dziewięć punktów względem poprzednika (15). Wynik ten stawia model na równi z OpenAI gpt-oss-120b i tylko punkt za większym Nemotron 3 Super (26). Najmądrzejsze małe modele w tej klasie rozmiarów, jak Qwen3.6 35B A3B (32 punkty) czy Meta Muse Glimmer (35 punktów), wciąż utrzymują wyraźną przewagę.
Nvidia celuje jednak w inny punkt na granicy efektywności. W testach przedpremierowych z finalnymi wagami NVFP4, model osiąga prawie 670 tokenów na sekundę – najwyższą zmierzoną przepustowość wśród wszystkich porównywanych modeli. Zadanie z Intelligence Index wykonuje w około 0,5 minuty, podczas gdy Qwen3.6 35B A3B potrzebuje około 3,5 minuty, a Gemma 4 31B około 5,8 minuty.
Największe usprawnienia pokazują się w benchmarkach agentowych. Na GDPval-AA v2 Lightning osiąga rating Elo 824 – to wzrost o 334 punkty względem Nemotron 3 Nano. Wynik ten przewyższa zarówno gpt-oss-120b (800), jak i większy Nemotron 3 Super (698). Na Terminal-Bench v2.1 wynik skacze z 7 do 24,3 procenta, niemal dorównując gpt-oss-120b z wynikiem 26,2 procenta.
Nvidia pracowała z partnerami takimi jak CodeRabbit i Harvey nad post-treningiem w celu zwiększenia wydajności w określonych domenach. Model jest dostępny zarówno w wagach BF16, jak i NVFP4, przy czym wariant NVFP4 również osiąga 24 punkty w Intelligence Index z minimalną stratą jakości w porównaniu z wersją o wyższej precyzji.
Wagi modelu są już dostępne, a inferencję serverless oferują DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius i Crusoe. Model obsługuje wyłącznie tekst z oknem kontekstu do miliona tokenów.
Lightning stanowi najjaśniejszy praktyczny dowód tezy Nvidia przedstawionej w szeroko dyskutowanym artykule z ubiegłego roku, gdzie naukowcy argumentowali, że modele poniżej 10 miliardów parametrów mogą obsługiwać większość zadań agentowych równie dobrze jak modele 70–175 miliardowe przy jednej dziesiątej do jednej trzydziestej kosztu. Z 31,6 miliarda parametrów, ale aktywując tylko 3,6 miliarda na krok, Lightning mieści się w tej lekkiej klasie, jednocześnie przewyższając większe modele w benchmarkach agentowych przy prędkości prawie 670 tokenów na sekundę.

Wywiady MIT Technology Review z dziećmi 10–18 lat pokazują ambiwalentne, pełne niuansów podejście młodych do AI – dane Pew Research i osobiste historie.

Roczny wskaźnik przychodów Anthropic przekroczył 65 mld dolarów, wyprzedzając wzrost OpenAI. Firma szykuje rekordowe IPO o wycenie 2 bilionów dolarów.

Microsoft tłumaczy opóźnienie kluczowej aktualizacji Exchange Server SE nadmiarem zgłoszeń błędów generowanych przez narzędzia AI.