Allen Institute for AI ujawnia architekturę Shippy, agenta AI do monitorowania morskiego, pokazując jak budować niezawodne systemy dla decyzji o wysokiej stawce.

Źródło zdjęcia: huggingface.co
Zespół Allen Institute for AI podzielił się szczegółowymi wnioskami z budowy Shippy, agenta AI służącego do monitorowania morskiego w czasie rzeczywistym. Artykuł techniczny ujawnia architekturę systemu zaprojektowanego do podejmowania decyzji o wysokiej stawce, gdzie błędna odpowiedź może kosztować znaczne zasoby lub zagrozić bezpieczeństwu personelu.
Shippy został zaprojektowany jako system trzech komponentów. „Dusza” to system prompt definiujący osobowość agenta i granice behawioralne. Umiejętności określają sposób obsługi konkretnych typów zapytań. Zarówno dusza jak i umiejętności są pakowane w obraz Docker — wersjonowany artefakt określający tożsamość Shippy.
Konfiguracja obejmuje wszystko inne: wybór harness'a agenta (OpenClaw), model językowy (Claude Opus 4.6) oraz ustawienia runtime'owe. Sekrety jak klucze API są wstrzykiwane podczas uruchomienia, a zmiana modelu lub harness'a wymaga jedynie zmiany konfiguracji, nie przebudowy.
Umiejętności Shippy wykorzystują tę samą specyfikację co narzędzia kodujące jak Claude Code i Codex — pliki markdown z ustrukturyzowanym frontmatter. Agent obecnie obsługuje zapytania do API Skylight o wydarzenia (zachowania statków jak połowy czy przeładunek), wyszukiwanie granic wyłącznych stref ekonomicznych (EEZ) i morskich obszarów chronionych (MPA), interpretację danych śledzenia statków oraz generowanie interaktywnych linków do map.
Kluczowym wyzwaniem było opanowanie niedeterministycznej natury agentów. Chociaż nie można kontrolować decyzji modelu, można uczynić narzędzia przewidywalnymi. Shippy komunikuje się z systemem Skylight przez dedykowane CLI, nie przez bezpośrednie wywołania API.
We wczesnych prototypach pozwalano Shippy na konstruowanie wywołań API od podstaw, co prowadziło do ciągłego strumienia subtelnych błędów: nieprawidłowej paginacji gubiacej wyniki, błędów kodowania geometrii i pozornie poprawnych zapytań zwracających niewłaściwe dane.
CLI Skylight redukuje tę złożoność do przewidywalnego interfejsu. Agent wydaje pojedynczą komendę z typowanymi flagami, a CLI obsługuje uwierzytelnianie, paginację i strukturalne wyjście. Narzędzie jest samodokumentujące się dzięki rozbudowanym tekstom pomocy i szczegółowym komunikatom błędów, które dostarczają agentowi i programistom wystarczającego kontekstu do naprawy błędów bez zgadywania.
System prompt jawnie definiuje, czego Shippy nie będzie robić. Agent nie podejmuje prawnych ustaleń dotyczących łamania prawa przez statki — to pozostaje domeną ludzi. Nie spekuluje też poza tym, co wspierają dane. Te granice są eksplicytne w system prompt, nie ukryte w fine-tuningu, co czyni je audytowalnymi i łatwymi do modyfikacji.
Architektura warstwowa — typowane API, deterministyczne CLI i umiejętności agenta odwołujące się do komend CLI — zapewnia, że każdy element systemu pozostaje przewidywalny mimo niedeterministycznej natury podstawowego modelu językowego.

Moonshot AI i Alibaba zaprezentowały zaawansowane modele AI dorównujące OpenAI i Anthropic, oferując je jako otwarto-źródłowe za ułamek kosztów.

Anthropic dodał do Claude Cowork funkcję nagrywania umiejętności przez screen recording z narracją. Zapisane zadania można potem automatycznie powtarzać.

Eksperymentalna aplikacja Adobe Project Indigo otrzymała narzędzia AI do usuwania obiektów i generowania efektów, zmieniając kierunek z profesjonalnej fotografii na edycję AI.