RZMRN
← cd ..SYSTEMY

Studio AI, które zbudowałem — i agenci, którzy je prowadzą

Wewnętrzne studio AI agencji creator-marketingowej, dziś obsługujące też klientów zewnętrznych. Zaprojektowałem i zbudowałem jego platformę generatywną, prowadzę flotę GPU i roje agentów, a także zespół i liczby wokół nich.

Studio AI, które zbudowałem — i agenci, którzy je prowadzą
ComfyUIOpen-weights image & video modelsLoRA / DoRAPythonFastAPISQLiteNext.jsDockerRunPod GPU fleetClaude CodeCodex

≈6×

Niższy koszt obliczeń na wideo

44% → 81%

Praca agentów, w jeden miesiąc

89% → 0%

Klatki z niewłaściwą twarzą

4,000+

Obrazy i wideo w cztery miesiące

Z wewnętrznych raportów i logów studia, zanonimizowane.

Wyzwanie

Agencja chciała zdjęć i wideo AI w skali produkcyjnej: spójne postacie, dostarczane codziennie, za rozsądne pieniądze. Nie było platformy, pipeline’u ani zespołu. Byłem jedynym inżynierem — co w 2026 roku oznacza: ja, specyfikacja i sporo agentów kodujących.

Hostowane API wideo liczyły za każdy klip tyle samo, jakość zależała od szczęścia, a nikt nie potrafił powiedzieć, ile naprawdę kosztuje dostarczone wideo.

Rozwiązanie

Na wejściu brief, na wyjściu zaakceptowane i dostarczone klipy. Pomiędzy: LLM, który pisze prompty, trwała kolejka zadań, klaster GPU z kilkoma silnikami ComfyUI, otwartymi modelami i dostrojeniami postaci LoRA/DoRA, automatyczne kontrole — i jeden ludzki werdykt.

Większość produkcji prowadzą roje agentów: od zebrania referencji klienta po render na flocie, pakowanie i dostawę. Licząc etapy, mniej więcej trzy czwarte należy wyłącznie do agentów. Ludzie trzymają trzy bramki: budżet, akceptację tożsamości i ostateczny werdykt. Autonomia to kontynuowanie zatwierdzonej pracy — a nie zmienianie moich decyzji.

Nowy klient zewnętrzny zamówił 100 klipów. 19,5 godziny po starcie miał 121 zaakceptowanych wideo — kolejka renderów pracowała w nocy bez nadzoru. Agenci sami wyłączają też swoje GPU, gdy kolejka się opróżni: palenie pieniędzy na bezczynność to błąd, a nie etap.

etapy 1–4 · plan

  1. 1BriefOdrzucany, zanim ruszy GPU, jeśli modele tego nie umieją
  2. 2PromptyLLM uzupełnia wartości; strukturę trzyma Python
  3. 3PrzeglądKażdy plan można poprawić przed wysłaniem
  4. 4KolejkaDzierżawy, heartbeaty, ponowienia, podział

Pipeline studia w ośmiu etapach: brief, prompty, przegląd, kolejka, klaster GPU, automatyczne QC, werdykt człowieka, dostawa. Nieudane QC ponawia się automatycznie; poprawka wraca do promptów.

etapy 5–8 · render, kontrola, dostawa

  1. 5Klaster GPUKilka silników ComfyUI; bezczynne pody są wyłączane
  2. 6Automatyczne QCDryf twarzy w embeddingach, metryki ruchu
  3. 7Werdykt człowiekaGOOD albo RETAKE, z klatek w pełnej rozdzielczości
  4. 8DostawaSpakowane z rejestrem sum kontrolnych

błąd QC → automatyczne ponowienie · RETAKE → z powrotem do promptów

Rezultat

Cztery miesiące po starcie od zera studio dostarczyło 4 000+ obrazów i wideo, weszło na rynek w 20 dni i dziś sprzedaje klientom zewnętrznym; treści AI ze studia stały się głównym źródłem ruchu agencji.

Poza platformą zatrudniałem i prowadziłem 2–4 operatorów (wydajność godzinowa operatora ×3,6 w jeden miesiąc), zbudowałem cennik i pakiety oraz co miesiąc raportowałem właścicielom koszty, jakość i prognozy — czerwiec i lipiec zamknęły się 11% i 8% poniżej prognozy.

Raporty z incydentów

Cztery problemy, co z nimi zrobiłem i co się zmieniło. Po jednej liczbie na każdy.

Wyciek tożsamości

89% → 0%

Problem

Dwie partie wykonane przez agentów wróciły z wadą w 16 przypadkach na 16: twarz postaci stopniowo zamieniała się w twarz osoby z referencji ruchu. Najłatwiejszy werdykt brzmiał: „model tego nie umie”.

Co zrobiłem

Nie zrzuciłem winy na model bez dowodów. Zbudowałem metrykę embeddingów twarzy klatka po klatce i przeprowadziłem testy A/B jednego czynnika na prawdziwym materiale. Znalazłem pięć przyczyn — wszystkie po naszej stronie — i wdrożyłem ostrzeżenia w walidatorach, przycinanie referencji i nową zasadę promptowania dla ludzi i agentów.

Wynik

Klatki z niewłaściwą twarzą: 89,3% → 0,0%.

Jeden pod, jeden klip, zero bezczynności

230 klipów w nocy

Problem

Partie wyglądały na wydajne — dopóki 7 z 13 czteroklipowych zadań nie padło z braku pamięci kontenera, zabierając ze sobą klipy w trakcie renderu. Pody stały bezczynnie między przekazaniami.

Co zrobiłem

Zastąpiłem partie zadaniami po jednej sztuce i dispatcherem z jednym rejestrem, więc podwójne przydzielenie jest niemożliwe z samej konstrukcji. Nieudane elementy przechodzą na inny pod; opróżnione pody są wyłączane automatycznie.

Wynik

230 klipów wyrenderowanych w nocy (5 h 47 min) na maksymalnie 12 kartach RTX 5090; 213 dostarczonych przy ~77% akceptacji za pierwszym razem (83% po poprawkach).

Wynająć, kupić czy API?

≈6× taniej

Problem

Hostowane API wideo liczyły za każdy klip tyle samo, więc każde nowe zamówienie podnosiło rachunek po linii prostej.

Co zrobiłem

Porównałem koszt dedykowanego serwera z wynajmem GPU (wygrał wynajem), a potem przeniosłem wideo na otwarte modele na własnej flocie — i zachowałem uczciwe porównanie, łącznie z jedną ścieżką, w której hostowane API pozostało tańsze.

Wynik

≈6× niższy koszt obliczeń na wideo w formacie masowym; wydatki na API wideo −89% w ciągu miesiąca.

Bramka wdrożeń, która przepuszczała

bramka CI: 1 145 testów

Problem

Wdrożenie to był rsync i ręczny restart, a raz wdrożenie zabiło trwający render na 20%. Pierwsza wersja zasady „nigdy w trakcie renderu” przepuszczała: błąd cudzysłowów plus „|| true” dawały „brak zadań”, gdy trwały dwa rendery.

Co zrobiłem

Prywatne repo, twarda bramka CI, wdrożenia jedną komendą z dziennikiem, snapshotem bazy, health checkami i rollbackiem — a obie bramki przepisane jako testowany kod.

Wynik

Każde wydanie przechodzi teraz bramkę CI z 1 145 testami automatycznymi i odmawia wdrożenia w trakcie renderu — sprawdzone na produkcji. Nieprzetestowane zabezpieczenie to dekoracja.

$ Czy sam to wszystko napisałem? Nie. Większość kodu powstała razem z agentami kodującymi. Moje jest to, czego agenci nie potrafią: architektura, specyfikacje, niezmienniki, review, odbiór — i decyzje produkcyjne o trzeciej w nocy.

Rola: AI & Automation Lead · architektura platformy, systemy agentów, flota GPU, zespół i ekonomika