26 artykułów z tym tagiem
LAION opublikował Big Video Dataset — 10 mln godzin wideo z YouTube do badań nad multimodalną sztuczną inteligencją.
Recenzja ZDNet: Comulytic Note Pro AI Voice Recorder łączy klasyczny dyktafon z transkrypcją AI, ale kosztuje więcej niż się wydaje.
EduRiskX łączy transformery z logiką F-Logic, wykrywając zagrożonych studentów już w 9. tygodniu semestru z dokładnością 0,900.
Google udostępnił Gemini Omni 1.1 Flash – model wideo z dłuższymi scenami, kontrolą kamery i tańszym trybem 360p dla deweloperów.
Google DeepMind wprowadza Gemini 3.5 Transcribe – precyzyjny model speech-to-text z niższym WER i błyskawiczną latencją dla deweloperów.
Alibaba udostępnia Wan3.0 – model generujący wideo do 30 sekund z tekstu, obrazów, PDF i prezentacji, z cenami od 0,05 dolara za sekundę.
Naukowcy z MIT wykazali, że przy dużych zbiorach danych treningowych nie da się jednoznacznie przypisać wygenerowanego obrazu do konkretnego dzieła.
Wyciek z macOS 26.7 RC ujawnia AirPods z kamerami i nowe domowe urządzenia Apple – firma szuka drugiej nogi biznesu po iPhonie.
LiquidAI udostępnia modele DSpark dla LFM2.5, przyspieszające wnioskowanie AI nawet 3,18x na GPU i 2,87x lokalnie, bez utraty jakości.
Badanie MIT CSAIL pokazuje, że przy dużych zbiorach danych pojedynczy obraz treningowy przestaje wpływać na wynik generatora AI — to zjawisko attribution decay.
Test Simona Willisona pokazuje, że model Qwen 3.8 27B od Alibaby domyślnie nadmiernie rozumuje, wydłużając proste zadania z minut do kwadransów.
OpenWALDO to nowy, wspólny zbiór danych treningowych AI z jawnym pochodzeniem — alternatywa dla zamkniętych i nieprzejrzystych modeli.