Local LLM Arena #5
Pierwszy prawdziwy test GPT-OSS jako lokalnego agenta programistycznego przyniósł więcej informacji, niż się spodziewałem — tylko niekoniecznie o samym modelu.
Okazało się, że pierwsza wersja testu miała problem z izolacją środowiska Codex CLI. Do kontekstu lokalnego modelu trafiały informacje o wtyczkach i narzędziach, które nie miały nic wspólnego z zadaniem programistycznym.
Dlatego wyniku tego testu nie traktuję jako miarodajnego wyniku GPT-OSS.
Zacząłem więc poprawiać środowisko: czyste sesje, brak chmurowego fallbacku, izolacja hidden testów, kontrola retry, timeouty i dodatkowa diagnostyka.
I tutaj pojawił się kolejny problem.
Sam system testujący zrobił się zbyt skomplikowany.
Kolejne preflighty potrafiły zawieszać procesy na wiele godzin, a podczas ostatniej próby Antigravity doszedł do około 48 GB (?!?!?) zajętej pamięci na MacBooku Air M4 z 16 GB RAM.
System w końcu przestał odpowiadać i potrzebny był twardy restart.
Na szczęście właściwy Trial #2 nigdy nie został uruchomiony, a po restarcie Mac wrócił do normalnego stanu: 0 MB swapu i około 87% wolnej pamięci.
Wniosek jest prosty: nie ma sensu dokładać kolejnych warstw do wadliwego harnessu.
Teraz robię krok wstecz.
Codex ma przeprowadzić audyt całej obecnej infrastruktury i pomóc zaprojektować prostszą wersję V4.
Założenia są już inne:
– każdy proces ma twardy timeout,
– żadnego czekania godzinami,
– test ma własny niezależny System Guard,
– w razie problemów zatrzymywana jest tylko grupa procesów trialu,
– hidden testy są całkowicie poza zasięgiem modelu podczas kodowania,
– iCloud nie jest częścią krytycznej ścieżki,
– Antigravity ma tylko przygotować i uruchomić test, a nie czekać na niego godzinami.
Cel się nie zmienił.
Tym razem jednak najpierw trzeba mieć pewność, że sam test nie jest groźniejszy dla Maca niż model, który ma sprawdzać.
#LocalLLM #LLM #AI #AppleSilicon #MacBookAir #M4 #LMStudio #Codex #GPTOSS #Coding #OpenSourceAI
Remote
Belzebubik
@Belzebubik@mastodon.com.pl
Lubię naukę, postawy prospołeczne, walkę z dezinformacją, związki zawodowe.
0 Followers
0 Following
4 Posts
Joined November 10, 2025
Open post
Replying to @oaj@mastodon.com.pl
@oaj@mastodon.com.pl @piwo@fosstodon.org Może zamiast szukać ludzi do robienia napisów całkowicie ręcznie, warto trochę zautomatyzować proces. Whisper całkiem dobrze radzi sobie z polskim i może od razu wygenerować napisy z kodami czasowymi w SRT/VTT. Wtedy wolontariusze musieliby głównie odsłuchać materiał i poprawić błędy, nazwiska czy specjalistyczne terminy, zamiast przepisywać wszystko od początku.
0
1
0
0
Open post
Replying to @oaj@mastodon.com.pl
@oaj@mastodon.com.pl @piwo@fosstodon.org A, rozumiem. Myślałem, że robisz to trochę inaczej, dlatego tak napisałem. Chciałem tylko coś doradzić, bo uznałem, że może Ci to ułatwić robotę.
0
1
0
0