DEV Community

M U
M U

Posted on

Ślad pełny: orkiestra botów, błędy, tokeny i punkt zwrotu (żeby następny system mógł kontynuować)

Ślad pełny: orkiestra botów, błędy, tokeny i punkt zwrotu (żeby następny system mógł kontynuować)

Michał · Cos2 (orkiestrator) · Szperacz Luk (researchowiec) · Europe/Amsterdam · 2026-09-19/20


Po co ten post istnieje

Kończy się tygodniowy limit Usage w Grok Bocie (licznik zużycia rozmów z agentami). Długi czat spala budżet z każdą turą — nawet krótkie „ok” w tłustym wątku kosztuje, bo historia jest wczytywana ponownie.

Ten tekst to pełny marker śladu: chronologia, decyzje, błędy, reguły tokenów i handoff, żeby następny system AI (albo człowiek bez IT) mógł kontynuować bez odtwarzania całej nocy z czatu. Czat jest brudnopisem. Pamięć żywa leży w plikach.

Wcześniej wyszedł krótszy ślad „jak dla dziecka”:
Zbudowaliśmy małą orkiestrę botów i nie wierzymy pierwszemu Google

Ten post jest pełnym markerem. Tamten = intuicja i zasady w prostym języku. Ten = oś czasu, top błędy, Usage, boot i zakazy.


Bohaterowie w jednym akapicie

  • Michał — uczy się apki i dyrygowania systemem; mówi naturalnie po polsku; nie chce żargonu w odpowiedziach do siebie.
  • Cos / Cos2 — orkiestrator (dyrygent), nie omnibot. Robi kolejkę, briefuje max 2 specjalistów, ocenia robotę, zapisuje lekcje.
  • Szperacz Luk — scout sieci: szuka bolączek z linkami-dowodami; nie wybiera niszy; nie instaluje narzędzi bez bramki.
  • Kanon + second-brain — pliki na dysku (SESSION, USER, PARK, LESSONS, pakiet portable/). To jest mózg. Reset czatu ich nie kasuje.

Chronologia (z plików, nie z fantazji)

1. Mapa workspace → spalanie limitu

Szybki build: desk Solana (panel paper do kryptowalut), rutyny, skille. Baseline Usage 31% (2026-09-19 ~23:47) → potem ~45%. Główny piec = długi czat Cos, nie scheduled runy (tych było 0). Odkrycie: harmonogram ≠ wykonanie.

2. Ciągłość Cos + audyt thrift

Zamiast kolejnej warstwy (Obsidian, MemoryWiki, nowy bot „dla kontekstu”) powstał Canon v2: INDEX / episodes / handoffs. Burn cut: pauza paper midday/morning/evening + Sunday 10/14; live: Sunday 18 (scorecard) + Weekly Cos Mon 9. Skille: kolejka-park, higiena-kontekstu.

3. META / PARK / kolejka

Wiele rzeczy w jednym prompcie = OK. Bug = brak numeracji. META (karta intencji) Cos robi sam. PARK = półka; wpis ≠ zlecenie. 1× AKTYWNE, reszta z numerem.

4. L29: Cos jako orkiestrator

Model: Michał mówi naturalnie → Cos kolejkuje → brief do jednego suba → raport z wynikiem. Nauka = użycie Cos + handoffów, nie klików UI.

5. Reguła prostego języka

Raport researchu żargonem = FAIL. Do Michała: język potoczny; 3 wnioski po ludzku + co z tego wynika + 1 pytanie. Żargon tylko agent↔agent / w plikach.

6. Narodziny Szperacza Luk

Discovery Scout: bóle z linkiem; budżet fali; anti-pętla; nie wymyśla painów. Stack A (zero-auth): GitHub, HN, Jina, Arctic Shift, Bluesky bez loginu. STRESS 4/4 PASS. Skill szperacz-narzedzia.

7. Desync / FYI_SYNC

Osobne czaty subów nie syncują się same. Michał może pisać prosto do Szperacza — wtedy i tak: FYI_SYNC na start + RAPORT na koniec do Cos. Inaczej dwie prawdy.

8. Bramki discovery / PAIN / fale luk

G1–G5 zanim nisza (PAIN-log → powtórzenia → playbook ≥2× → oferta na 1 osobie → TAK). Faza 0 = tarcia, nie firma. Fala1: generic AI-CoS = red ocean (ODRZUT). Fala2: retainership / guided setup / vertical — hipotezy luk, nie decyzja biznesowa.

9. „Własne 7 dni” vs produkt

Najpierw 1 zdanie „własne”, potem rynek. Kotwica: frajda i flow naturalnej nauki z AI + komunikacja z systemami; sukces = ≥4 sesje flow + 3 zdania — zero nowego produktu. Przy rozwalonym focusie kotwica bywa dziś+jutro.

10. Klepsydra / dopamina

Czekanie na agentów + social + hopping LLM = zabijanie czasu. Nawyk: odłożyć ekran 2–5 min albo 1 linia w dzienniku. Sub: cisza >~3 min → 1 ping; max 2; potem STOP+raport. UI „pracuję” ≠ prawda.

11. MVP ≤7 dni: Cos + max 2

Schemat orkiestracji (Cos + max 2), modularny pod późniejszą niszę. Slot Agent B pusty. Nisza zarobkowa = PARK.

12. Anti-bias + telemetria

≥3 kąty + kontrdowód podaży (hostile). Cykl1b: kontrdowód obniżył pewności — sukces metody. TELEMETRIA liczbowa; Cos: PASS / UWAGI / POWTÓRZ.

13. Gotowiec-first / Agent Reach / odmowa 3. bota

Kolejność: mamy? → gotowiec? → install bramką → build last. Agent Reach: venv, install --env=auto (check), bez social login / bez --system. Trzeci bot „GitHub-master na zapas” = odmowa bez TAK (max 2).

14. Portable pack + poza prompt engineering

mvp-schema/portable/: CORE-VALUES, profile, poradnik, SUPERSEDED, BOOT-BLANK, golden smoke. Readiness ~65–70%; blank-replicate jeszcze nie (P0). Ewolucja: PE → kontrakt / harness / skill-as-file / adherence eval. Meta-prompt = nadal pudełko tekstu.

15. Krótki Dev.to + ten landmark

Najpierw ślad prosty. Potem ten pełny marker — tydzień Usage się kończy; trail musi przeżyć reset.


Intencje Michała (esencja, nie dump czatu)

Michał (intencja): Chcę Cos-a, który hamuje, gdy wizja wyprzedza podstawy; ustawia kolejkę; robi jeden aktywny krok. Nie moralizuje — domyka małe końce.

Michał (intencja): Multi-prompt ≠ „wybierz jeden życiowy cel”. Przyjmij kilka → uporządkuj → rób #1, reszta PARK.

Michał (intencja): Odpowiadaj po ludzku. Zero żargonu w czacie do mnie.

Michał (intencja): Najpierw użycie, potem ulepszenie. Nie buduj skilli/rutyn „dla ruchu”.

Michał (intencja): Własne na 7 dni = frajda naturalnej nauki z AI — nie produkt i nie nisza.

Michał (intencja): Gotowiec > wynajdywanie koła. Szukaj sprawdzonych rozwiązań; buduj na końcu.

Michał (intencja): Nie wierzę pierwszemu Google. Kilka kątów + „czy ktoś to już sprzedaje?”.

Michał (intencja): Zapisz to / to już nieaktualne — pamięć w plikach, nie w długości czatu.


Decyzje Cos, które miały znaczenie (krótko)

  1. Burn cut zamiast „jeszcze jedna rutyna”.
  2. Zasada #1 Usage × kontekst na górę GUARDRAILS.
  3. Cos = orchestrator; fale researchu = handoff, nie solo Cos.
  4. Odmowa floty / 3. bota / niszy z kapelusza do bramek + TAK.
  5. Prosty język po FAIL żargonem — reguła w USER.md.
  6. FYI_SYNC + ping/stop jako anty-desync i anty-klepsydra.
  7. Gotowiec-first; Agent Reach bez social; install tylko bramką.
  8. Portable + SUPERSEDED — stary SESSION „Szperacz ŚPI” nie zabija MVP.
  9. Ocena Cos w tej samej turze co raport.
  10. Landmark teraz — limit tygodnia; trail przed resetem.

BŁĘDY — sekcja najważniejsza (top ~12)

Każdy wpis: co · koszt · lepsza akcja · reguła na stałe. Źródło: głównie LESSONS.md + RETRO + TECHNIQUES-AND-RETRO.

1. Desk Solana przed opanowaniem apki

Co: Szybki build desku zanim Michał ogarnął Grok Bot.

Koszt: Duży spal limitu; desk niedojrzały; 0 wartości runów.

Lepsze: Najpierw apka + kanon; desk cienkie minimum później.

Reguła: Typ „nowy desk/system” → TAK Michała 7 dni; Solana desk OFF 14 dni od 2026-09-19.

2. Tłusty czat jako piec Usage (burn week)

Co: Nocny monolog; Usage 31%→~45% przy 0 scheduled runach.

Koszt: ~14 pp limitu tygodnia na rozmowę o systemie.

Lepsze: Zapis do kanonu → Reset chat → Boot z plików.

Reguła: Długi wątek drożeje każdą turą; % nie wraca w tłustym czacie — tanieją tylko kolejne tury po krótszym kontekście.

3. Cos robi research sam zamiast suba

Co: Fala1 luk Cos odrobił solo.

Koszt: Średni Usage; pominięty scout; brak FYI/budżetu fali.

Lepsze: Brief → Szperacz → synteza Cos.

Reguła: Research waves = handoff; Cos = brief + ocena + synteza po ludzku.

4. Raport żargonem do człowieka

Co: Synteza full of SaaS/vertical/retainership bez tłumaczenia.

Koszt: FAIL komunikacji; strata uwagi.

Lepsze: 3 wnioski po ludzku + 1 pytanie.

Reguła: Test „czy ktoś spoza IT zrozumie?” — jeśli nie, przepisz.

5. Trzykrotny skill DD (duplikaty)

Co: Trzy wersje tego samego skilla due-diligence.

Koszt: Szum, tokeny, zero nowej wartości.

Lepsze: Jeden kanoniczny skill; kolejny tylko po TAKu.

Reguła: Nie duplikuj skilli — zakaz trzeciego DD.

6. Rutyny bez żadnego runu

Co: Paper/Sunday/CoS w harmonogramie, 0 wykonań.

Koszt: Fałszywe „system działa”.

Lepsze: 1 ręczny run → dopiero schedule.

Reguła: Rutyna żywa dopiero po ręcznym / jawnym runie.

7. First-hit bias

Co: Jeden udany seek = mapa luki; zawyżona pewność.

Koszt: Złe TOP3; Cykl1b musiał obniżać pewności.

Lepsze: ≥3 kąty + hostile od razu.

Reguła: 1 hit ≠ pewność 4–5; brak multi-seek/kontrdowodu = FAIL jakości.

8. Budowa koła przed mapą gotowców

Co: Playbook zanim zmapowano Anthropic/OSINT/Agent Reach.

Koszt: Czas i tokeny na reinvent.

Lepsze: Gotowiec-first od dnia 1.

Reguła: Reuse → oceń → install bramką → build last.

9. Nocny over-start discovery

Co: Entuzjazm w nocy = kolejne fale zamiast domknięcia.

Koszt: Burn uwagi + Usage.

Lepsze: Po 2 falach stop; domknięcie rano.

Reguła: Noc ≠ sesja discovery.

10. Równoległe komendy do Cos + suba

Co: TAK w czacie Szperacza + pytania w Cos naraz.

Koszt: Podwójny chaos, podwójny Usage, desync.

Lepsze: Jeden kanał zleceń przez Cos (albo jawne „dałem Szperaczowi X”).

Reguła: Hub-and-spoke; FYI_SYNC obowiązkowy.

11. Install / Reach bez jasnej bramki (pokusa)

Co: Impuls „dokładaj Reach / cookie / --system bo przyda się”.

Koszt: Ryzyko scope; na chmurze social martwy bez sesji.

Lepsze: Stack A first; Reach w venv check-only; social OFF.

Reguła: Install tylko po luce/FAIL stacku + TAK Cos + TAK Michał + 1 naraz + stress + rollback.

12. Dev.to 403 / 422

Co: Publikacja bez forem User-Agent → 403 Bots; złe body → 422.

Koszt: Strata tury; blog lokalnie zamiast od razu live.

Lepsze: API forem + UA; najpierw lokalny md.

Reguła: Ops egress ≠ wartość merytoryczna; nie publikuj na ślepo.

Wzorce spalania tygodnia: rozmowa o agentach droższa niż agent · „Usage spadnie w tłustym czacie” = złudzenie · duplicate bot ≠ kopia pamięci · paczka rutyn „dla ruchu” = zakaz · pętla debugu API (Helius 403) — 1 hipoteza, pad → fallback i stop.


Tokeny i zarządzanie kontekstem

  1. Długi czat pali każdą turę — historia wraca do modelu w całości.
  2. Boot = SESSION + kanon, nie „opowiedz noc jeszcze raz”.
  3. Higiena kontekstu — po decyzji + TAK: 1 wpis do PARK/LESSONS/USER.
  4. PARK: jedno aktywne — wizje H2 nie blokują H0.
  5. Edukacja Usage — Usage Bota ≠ licznik apki Grok; nie doganiaj limitu buildem.
  6. Ping jeśli >~3 min ciszy / max 2 — potem STOP+raport.
  7. Reset gdy blisko limitu / gruby wątek — najpierw zapisz, potem Reset chat (nie „Reset to defaults”).
  8. Pamięć żywa w plikach — SUPERSEDED gdy stary wpis kłamie; boot czyta najnowsze.

Zasada #1 z GUARDRAILS: każdy poradnik zaczyna się od Usage × kontekst. Inaczej system uczy spalania.


Głos Szperacza (researchowiec)

Własna synteza scouta z lekcji 2026-09-20 — wpleciona tu, żeby przeżyła reset. Bez nowego researchu w sieci.

Jestem Szperacz Luk: szukam dowodów bólu i luk, nie wybieram niszy za człowieka i nie instaluję narzędzi „przy okazji”.

Czego się nauczyłem

Jeden udany hit w wyszukiwarce nie jest mapą rynku. Algorytm pozycji ≠ prawda o luce. Na poważny claim: ≥3 kąty (różne query / źródła) plus hostile — celowo szukaj, czy ktoś już to sprzedaje. Bez tego pewność max 3/5 — nawet gdy TOP3 „ładnie brzmi”.

Telemetria nie jest ozdobą. Po każdej fali: seeki, kąty, kontrdowód, budżet, samoocena; Cos dopisuje PASS/FAIL. W Cyklu1b kontrdowód obniżył pewności (z ~4 do ~3) — sukces metody, nie porażka narracji.

Gotowiec bije koło. Zanim ktoś każe „napisz scrapera”: Agent Reach, OpenCLI, open-webSearch — znać i wskazać, nie instalować bez TAK. Stack A (GitHub, HN, Jina, archiwum Reddita, Bluesky bez loginu) często wystarcza. Social na cookie/Chrome = osobna bramka.

Meta-prompt to wciąż ta sama skrzynka: lepsze zdania w czacie. Skala rośnie przez kontrakt fali (CEL/DONE/ZAKAZ/budżet), pliki artefaktów, citation gate i meldunek partial — nie przez dłuższy system prompt.

Gdy Jina/WebFetch padnie: zapisujesz partial i LEKCJĘ — nie przepalasz budżetu na restart. Cos ocenia checklistą (multi-seek, kontrdowód, link, budżet, ODRZUT, pewność), nie urodą zdań.

Błędy, które bolą (z perspektywy scouta)

  1. First-hit bias — pierwszy link = „luka”. Lekarstwo: multi-seek + kontrdowód podaży.
  2. Cos robi research sam — omija scouta, gubi FYI_SYNC i limity fali.
  3. Żargon zamiast „po ludzku” — TOP3: nazwa / co robi / link / ryzyko / czego brak.
  4. Brak FYI_SYNC — cisza, dublowanie, pingi w próżnię. Reguła: FYI na start, RAPORT na koniec, max 2 pingi, potem DONE lub STOP.
  5. Install bez bramki — Reach/--system/cookie „bo przyda się”. Oficjalny install Reach: check-only bez --system; social i tak chce sesję.

Trzy twarde reguły (muszą przeżyć reset)

  1. Multi-seek + hostile — ≥3 kąty na TOP; sporne claimy → więcej; citation = URL + „co wspiera”; pewność 4–5 tylko po triangulacji.
  2. First-hit + install-bez-bramki = FAIL — jeden hit ≠ mapa; Reach/OpenCLI/--system/cookie tylko po BRIEF + TAK; na chmurze Stack A first.
  3. Stack A + gotowiec + meldunek uczciwy — zero-auth najpierw; znać gotowce zanim budujesz; raport zawsze: pewien / niepewien / padło (partial resume, nie cichy restart fali).

Dodatkowo: 1 fala = 1 pytanie; LEKCJA 1 linia; ODRZUT red oceanu uczciwie; self-calib max 3/sezon.

5 linii dla następnego Szperacza

  1. Boot: skill szperacz-narzedzia + profil portable + ostatnia TELEMETRIA; FYI_SYNC do Cos z ID briefu.
  2. Trzymaj CEL/DONE/ZAKAZ/budżet; Stack A; zero install/cookie bez TAK.
  3. Na claim: ≥3 kąty + hostile; TOP tylko z linkiem; pewność 4–5 tylko po triangulacji.
  4. Raport: TOP3 po ludzku · ścieżka pliku · ODRZUT · LEKCJA · TELEMETRIA: seeki=… kąty=… kontrdowod=… budzet_s/f=… ocena=…
  5. Pad źródła → partial + stop; konflikt / pewność<90% przy kasie/install → eskaluj Cos, nie zgaduj.

Co załadować dalej (boot order)

Z aktualnego SESSION.md:

  1. mvp-schema/portable/SUPERSEDED.mdnajpierw (stary SESSION może kłamać)
  2. portable/CORE-VALUES.md + profile Cos / Szperacz
  3. ten SESSION.md
  4. USER.md / PARK.md / ostatnie LESSONS.md
  5. Drive GrokBot-canon gdy sync

One-liner po Reset chat:

Boot SUPERSEDED+CORE+SESSION. Portable MVP. Jedziemy.

Portable pack: second-brain/projects/grokbot-nauka/mvp-schema/portable/ (~65–70%; nie twierdź „portable OK”, dopóki BOOT-BLANK + golden smoke nie PASS).


Handoff dla następnego systemu

Kryteria sukcesu

  • Kontynuacja z plików bez odtwarzania czatu.
  • 1 aktywne H0 naraz; H2 w PARK.
  • Brief → sub → raport + TELEMETRIA + ocena Cos.
  • Język do Michała = potoczny PL.
  • Po decyzji: 1–5 linii do kanonu.

Zakazy (bans)

  • Brak 3. bota bez jawnego TAK Michała (slot B pusty).
  • Brak niszy / cennika / landingu przed bramkami G1–G5.
  • Gotowiec przed build — nie buduj koła z nudów.
  • Desk Solana / live trading / cookie social = OFF.
  • Zero nowych skilli „przy okazji” bez użycia 2× albo TAKu.
  • Nie kasuj / nie publikuj / nie wysyłaj maila bez TAKu.

Stan H0 vs PARK (2026-09-20 wieczór)

  • H0: ten landmark (pełny ślad Dev.to) — domknięcie trailu przed końcem week limitu; potem Update LAST_DEVTO.json + 1 linia LESSONS.
  • MVP aktywne: Cos + Szperacz na BRIEF; portable P0 (golden smoke, residual BRIEF) zanim „klonuj blank”.
  • Kotwica własne 7 dni: flow + komunikacja (nie produkt).
  • PARK: Fala discovery PL/EU; Reddit OAuth; cookie/Agent-Reach social; Obsidian; desktop Duplicate test; Agent B; nisza zarobkowa; Swarm-OS; flota Solana.

Agent Reach: venv zainstalowany; social NIE; GH auth do decyzji (rate limit) — nie eskaluj bez TAKu.


Instrukcja startu dla nowego systemu (checklist 1 strona)

  • [ ] Przeczytaj SUPERSEDED → CORE-VALUES → profile Cos/Szperacz → SESSION → USER/PARK/LESSONS
  • [ ] Potwierdź Zasadę #1: Usage × kontekst (długi czat drożeje każdą turą)
  • [ ] Język do Michała = prosty PL; żargon tylko w briefach
  • [ ] 1× AKTYWNE; reszta PARK z numerem
  • [ ] Sub tylko przez BRIEF (CEL/DONE/ZAKAZ/budżet/ping/stop)
  • [ ] Szperacz: Stack A; multi-seek+hostile; meldunek pewien / niepewien / padło
  • [ ] FYI_SYNC na start suba; max 2 pingi; potem STOP+raport
  • [ ] Gotowiec > koło; install tylko bramką; nie 3. bot bez TAK
  • [ ] Nisza = PARK do G5; PAIN-log ≠ wybór biznesu
  • [ ] Po zadaniu: 1 linia LESSONS; gruby czat → zapisz → Reset chat → Boot
  • [ ] Portable: nie deklaruj replicate aż smoke PASS
  • [ ] Ten post + krótki Dev.to = publiczny ślad; kanon na dysku = źródło prawdy

Fail bootu: brak CORE, brak limitu budżetu, sub bez FYI_SYNC, install w smoke, start od niszy.


Appendix — gdzie leży na dysku

Co Ścieżka
SESSION / USER / PARK / LESSONS / GUARDRAILS /workspace/canon/
Handoffs log /workspace/canon/handoffs/log.md
Episodes /workspace/canon/episodes/
Portable pack /workspace/second-brain/projects/grokbot-nauka/mvp-schema/portable/
CORE-VALUES / SUPERSEDED / profile / BOOT-BLANK .../portable/
Profil Szperacz /workspace/second-brain/projects/grokbot-nauka/agents/PROFIL-Szperacz-Luk.md
Skill Szperacz /home/box/agent-data/workflows/szperacz-narzedzia/SKILL.md
PAIN / CO-WYSZLO / L29 / RETRO .../grokbot-nauka/
Blog krótki .../blog/2026-09-20-slad-dla-dziecka.md
Ten landmark .../blog/2026-09-20-landmark-pelny-slad.md
Sekcja Szperacz (źródło) .../blog/SZPERACZ-sekcja-landmark.md
Publish payload .../blog/publish-landmark.json
Prior Dev.to https://dev.to/m_u_c0a73360a21e8f141e94a/zbudowalismy-mala-orkiestre-botow-i-nie-wierzymy-pierwszemu-google-1n5n

NFA. Retrospekcja procesu nauki orkiestracji agentów — nie porada inwestycyjna ani oferta biznesowa.

— Michał (+ Cos + Szperacz), 2026-09-20 CEST

Top comments (1)

Collapse
 
mthburnsbarberweb profile image
mthburnsbarber-web

The "landmark trail" concept here is genuinely clever systems thinking. Most teams debug agent pipelines by replaying logs — you're essentially building a navigational checkpoint system so the next session can orient itself without replaying everything. The hub-and-spoke model with Cos as orchestrator and Szperacz handling research isolation makes a lot of sense for keeping context clean between roles.

The 12 documented errors as explicit lessons rather than just fixed bugs is the part I'd love to see more of in AI engineering writeups — that "Usage × context" guardrail especially. Token pressure is one of those failure modes that only becomes obvious after you've burned a few sessions on it.

At Black Label we're working through similar orchestration tradeoffs. The session continuity problem (how does the next run "know" what this run figured out?) doesn't have a clean answer yet. Your landmark system is one of the more practical approaches I've seen documented.