12 artykułów z tym tagiem
KVBoost przyspiesza inferencję LLM 4,49x dzięki cache'owaniu KV na poziomie fragmentów, bez utraty dokładności modelu Qwen2.5–3B.
LiquidAI udostępnia modele DSpark dla LFM2.5, przyspieszające wnioskowanie AI nawet 3,18x na GPU i 2,87x lokalnie, bez utraty jakości.
Replikacja badania nad α-FLOPs pokazuje, że liczba operacji FLOP-ów słabo szacuje realny czas wykonania na nowszym sprzęcie AI.
Naukowcy z Multiverse Computing opracowali metodę obniżającą koszty destylacji z 250GB do 128GB VRAM, umożliwiając trening na pojedynczej karcie GPU.
Rafał Cyrański tłumaczy, jak sztuczna inteligencja zmienia wyszukiwanie i dlaczego firmy muszą budować swoją obecność w systemach AI, a nie tylko w Google.
Metoda DivInit zwiększa skuteczność agentów AI o 5–7 punktów przez dywersyfikację zapytań początkowych zamiast standardowego równoległego próbkowania.
Naukowcy opracowali metodę opartą na architekturze Transformer, która osiąga wyniki w 15–30% od optymalnych w problemach harmonogramowania warsztatów.
Badanie z arXiv przedstawia koncepcję warstwy weryfikacyjnej, która ocenia praktyczną niezawodność rozwiązań optymalizacyjnych pod wpływem perturbacji.
Google oficjalnie zaprzecza potrzebie specjalnych strategii SEO dla AI. Firma twierdzi, że popularne koncepty GEO i AEO to zwykłe SEO pod nową nazwą.
ARR zastępuje nieprzeźroczyste sygnały nagrody strukturalnymi kryteriami, przewyższając tradycyjne metody w testach generowania obrazów.
ServiceNow AI opisuje cztery kluczowe poprawki potrzebne do migracji z vLLM V0 do V1 w kontekście trenowania modeli RL.
OpenAI zaleca porzucenie starych promptów dla GPT-5.5. Minimalne instrukcje przewyższają złożone, a definicje ról wracają na szczyt zalecanej struktury.