Chiński model Kimi K3 zajął pierwsze miejsce w benchmarku programistycznym, ale osiąga tylko 39% dokładności w zaawansowanych zadaniach matematycznych.

Źródło zdjęcia: The Decoder
Chiński model Kimi K3 od firmy Moonshot zyskuje coraz większą uwagę w zachodniej społeczności AI. Według najnowszych testów opublikowanych przez The Decoder, model prezentuje mieszane wyniki w porównaniu z najlepszymi zachodnimi rozwiązaniami.
W benchmarku Code Arena: Frontend, który ocenia modele na podstawie preferencji użytkowników, Kimi K3 osiągnął wynik 1679 punktów, wyprzedzając Claude Fable 5 (1631 punktów), GPT-5.6 Sol (1618 punktów) i wszystkie inne testowane modele ze znaczną przewagą. To pierwszy przypadek, gdy chiński model zajął pierwsze miejsce w tym benchmarku.
Sukces Kimi K3 w benchmarku Code Arena: Frontend stanowi znaczący moment dla chińskiej branży AI. Benchmark ten ocenia modele na podstawie ludzkich preferencji, co czyni go szczególnie wiarygodnym miernikiem praktycznej użyteczności. Przewaga 48 punktów nad Claude Fable 5 i 61 punktów nad GPT-5.6 Sol to wyraźny sygnał, że chińskie modele mogą konkurować z najlepszymi zachodnimi rozwiązaniami w określonych zastosowaniach.
Dane z Epoch AI ujawniają jednak poważne ograniczenia Kimi K3 w bardziej wymagających zadaniach. W najtrudniejszym poziomie FrontierMath Tier 4, który testuje zdolności w rozwiązywaniu eksperckich problemów matematycznych, chiński model osiąga jedynie 39% dokładności. To drastyczna różnica w porównaniu z modelami OpenAI i Anthropic, które w niektórych przypadkach zbliżają się do 90% skuteczności.
Ta rozbieżność w wynikach ilustruje nierównomierny rozwój chińskich modeli AI, które mogą doskonalić się w określonych dziedzinach, ale wciąż pozostają w tyle za zachodnimi konkurentami w najbardziej wymagających zadaniach analitycznych.
Kimi K3 pokazuje, że chiński sektor AI rozwija się w kierunku specjalizacji w praktycznych zastosowaniach programistycznych, choć wciąż wymaga znacznych ulepszeń w obszarach wymagających zaawansowanego rozumowania matematycznego.

Gubernator Teksasu Greg Abbott zamroził wydatki na kamery Flock po śledztwie ujawniającym wydanie ponad 30 mln dolarów na system AI.

Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.

Caterpillar wykorzystuje wiedzę z automatyzacji kopalni do wdrażania AI na placach budowy i inwestuje 100 mln dolarów w szkolenia pracowników.