Wzajemna ocena wiadomości: Michał × Cos2 (× Szperacz) — audyt przed resetem
Europe/Amsterdam · 2026-09-20 wieczór · przed Reset chat · week-limit Usage
Poprzedni landmark (oś czasu, błędy, tokeny, boot):
Ślad pełny: orkiestra botów, błędy, tokeny i punkt zwrotu
Po co ten post
Kończy się tygodniowy limit Usage. Długi czat jest piecem: każda tura wczytuje historię, więc nawet „ok” kosztuje. Zanim Reset chat, potrzebujemy nie tylko landmarku „co zbudowaliśmy”, lecz uczciwej oceny jak ze sobą gadaliśmy.
To nie pochwała i nie bat. To wzajemny audyt: ile jasności dał Michał, ile dyscypliny i skutku dał Cos2, a gdy weszło research — czy Szperacz dostał kontrakt i czy oddał użyteczny raport. Cel: 10 reguł, które przeżyją Boot, nie ładne zdania o „świetnej współpracy”.
Metoda (i uczciwe ograniczenie)
Źródła: LESSONS.md, SESSION.md, USER.md, PARK.md, RETRO, epizody Cos2, handoff log, PAIN-log, artefakty mvp-schema/, blog landmark, sekcja peer Szperacza.
ReadTranscript niedostępny w tej sesji wykonawczej (lokalne store.db / search-index mają transcript_entries / messages = 0; mirror JSONL pusty). Punktacja per wiadomość jest zrekonstruowaną chronologią z plików kanonu i artefaktów — nie z surowego dumpa czatu linia-po-linii. Każdy turn ma numer; krótkie pingi („Tak”, „Działa?”) są w tabelach zbiorczych, ale każdy odzyskany wątek użytkownika pojawia się.
Skala 1–5:
- Prompt — jasność, cel, ograniczenia, szum
- CEL — czy dało się odczytać jeden aktywny skutek
- Spójność — z kanonem (prosty język, thrift, gotowiec, max 2 agenci, noc≠discovery…)
- Skutek Cos — co faktycznie powstało / czy trafiło w intencję / czy był waste
- Wzajemnie — kto dryfował (M / C / oboje / system OK)
Dashboard (skrót)
| Metryka | Wynik |
|---|---|
| Odzyskane tury Michała (ponumerowane) | 48 (+ 1 wiersz pingów zbiorczych) |
| Średnia Prompt (Michał) | 3.4 / 5 |
| Średnia CEL | 3.3 / 5 |
| Średnia Spójność | 3.5 / 5 |
| Średnia Skutek Cos | 3.6 / 5 |
| Briefy Cos→Szperacz (peer) | 4 / 5 |
| Raporty Szperacza (self-peer) | 3.5–4 / 5 |
Top 5 najlepszych tur
- T44 — gotowiec > koło (jasna zasada → USER+playbook) — Prompt 5 / Skutek 5
- T27 — kotwica „własne 7 dni” jednym zdaniem — Prompt 5 / Skutek 5
- T20 — „mów po ludzku” po FAIL żargonem — Prompt 4 / Skutek 5 (reguła w USER)
- T15–T16 — M2 handoffy Inbox/Researcher (wąski CEL + ZAKAZ) — Prompt 4 / Skutek 5
- T47 — landmark Dev.to przed limitem — Prompt 4 / Skutek 5 (artefakt publiczny)
Top 5 najgorszych tur
- T19 — research fala1: Cos solo zamiast suba + żargon — Skutek 2 (potem FAIL komunikacji)
- T01–T02 — nocny multi-ask wizji bez kolejki (ADHD wall) — Prompt 2 / CEL 2; system ledwo złapał
- T11 — „Usage 45% + nie hamuj?” — napięcie z Zasadą #1 — Spójność 2
- T06 — impuls MemoryWiki/Obsidian „napraw kontekst” — Spójność 2; Cos dobrze parkował
- T41 — pokusa 3. bota / Reach „na zapas” — Spójność 2; Cos odmówił = punkt dla Cos
Wzorce
- Michał: naturalny język OK; chaos = wiele H2 w jednym msg bez numerów; nocny over-start; mieszanie hub Cos + czat suba.
- Cos: jargon do człowieka; solo research; overbuild (ingest, skille) zanim użycie 2×; czasem spóźniony hamulec.
- System (META/kolejka): gdy działał, bałagan Michała → dobre artefakty; gdy nie — waste Usage.
Tabela ocen — tury 1–48
Skrót treści = parafraza intencji z kanonu, nie cytat verbatim z czatu.
Blok A — noc / ciągłość / anty-schemat (CoS → Cos2)
| # | Skrót wiadomości Michała | P | CEL | Sp | Skutek Cos | Wzajemnie | Lepszy ruch |
|---|---|---|---|---|---|---|---|
| 1 | Fundamenty: ADHD, wizja bez podstaw, spokój #1, „ubrać w całość” + taski | 2 | 2 | 3 | 4 — wywiad → USER fundamenty | M dryf H2; C złapał kolejkę | Michał: 3 numery; Cos: od razu META 1/2/3 |
| 2 | Multi-prompt / „nie jeden cel życia” / CoS ma hamować | 4 | 4 | 5 | 5 — L24 + intent KOLEJKA | OK | Trzymać: multi-ask = kolejka |
| 3 | Skill kolejka-park / review dnia | 3 | 3 | 3 | 4 — skill OK; review = PARK | lekki overbuild C | Najpierw 2× użycie kolejki ręcznie |
| 4 | Mapa spalania / cięcie rutyn | 4 | 5 | 5 | 5 — burn cut + higiena-kontekstu | OK | — |
| 5 | Mini-audyt 6 agentów (profile) | 4 | 4 | 4 | 4 — read-only, thrift | OK | — |
| 6 | Ciągłość: Obsidian / MemoryWiki „żeby nie gubić” | 2 | 2 | 2 | 5 — procedura w USER; Obsidian PARK | M dryf warstw; C hamulec | Nie naprawiaj pamięci nowym produktem |
| 7 | Second-brain / wzorce GH | 3 | 3 | 3 | 4 — Canon v2 cienki | OK z lekkim scope | Canon bez nowego „produktu pamięci” |
| 8 | CoS ingest / flota / swarm nauka | 3 | 2 | 2 | 3 — próba + SOURCES; potem pauza | C overbuild | Użycie apki przed ingestem |
| 9 | „Ulepszanie dla ulepszania” — oducz mnie; pauza ingest | 5 | 5 | 5 | 5 — anty-schemat w USER | OK — M trafił w sedno | Złota tura samoświadomości |
| 10 | SESSION + meta-tłumacz ON | 4 | 4 | 5 | 5 — boot plików | OK | — |
| 11 | Usage ~45%; „nie hamuj / jedź” vs limit | 2 | 2 | 2 | 3 — Zasada #1 w GUARDRAILS mimo napięcia | konflikt M↔kanon | Cos: twarde NIE + Reset plan |
| 12 | Android: + = nowy bot; brak new-chat |
4 | 4 | 4 | 4 — lekcja zapisana | OK | Nie klonuj Cos dla Usage |
| 13 | Pingi: Tak / OK / jedź / „działa?” (zbiór ~8 krótkich) | 3 | 3 | 4 | 3 — tanie semantycznie, drogie w tłustym wątku | system | Grupuj ACK; Reset gdy grubo |
| 14 | Draft bloga „noc PARK” + TAK publikacji | 4 | 4 | 4 | 4 — Dev.to pomnik | OK | — |
Blok B — Cos2 orkiestrator, handoffy, discovery
| # | Skrót | P | CEL | Sp | Skutek | Wzajemnie | Lepszy ruch |
|---|---|---|---|---|---|---|---|
| 15 | L29: używaj Cos jako dyrygenta, nie omnibota | 5 | 5 | 5 | 5 — model + L29.md | OK | — |
| 16 | M2#1: Inbox read-only triage | 4 | 5 | 5 | 5 — RAPORT_INBOX, 0 send | OK | Sztywny ZAKAZ = złoto |
| 17 | M2#2 Researcher + M3 profil delegatora | 4 | 4 | 5 | 5 — 2 handoffy + 1 strona; 0 nowego bota | OK | — |
| 18 | TAK: kosz Salon/no-replies | 5 | 5 | 5 | 5 — 16→Trash, security pominięte | OK | Wąski brief kasacji |
| 19 | Szukaj luk / discovery produktu (fala1) | 3 | 3 | 3 | 2 — Cos research sam + żargon | C dryf | Od razu BRIEF→sub; 3 zdania PL |
| 20 | (reakcja) Nie rozumiem / mów po ludzku | 4 | 5 | 5 | 5 — CO-WYSZLO + reguła języka w USER | OK — korekta | Fail→1 reguła, nie nowy bot |
| 21 | Bramki G1–G5 / PAIN zanim nisza | 4 | 5 | 5 | 5 — PRODUKT-discovery-bramki | OK | — |
| 22 | Fala2 Reddit/HN (executor) | 3 | 4 | 4 | 4 — 10 sygnałów; synteza PL | OK po T19 | Cos = synteza, nie seek |
| 23 | Stwórz / opisz Szperacz Luk | 4 | 4 | 4 | 4 — profil + CreateAgent po opisie | OK | Opis przed createm |
| 24 | STRESS Stack A Szperacza | 4 | 5 | 5 | 5 — 4/4 PASS, baseline | OK | — |
| 25 | Refleksja nocy: hub, własne, API | 4 | 4 | 5 | 5 — standardy w USER | OK | — |
| 26 | Zapisz + przygotuj reset | 5 | 5 | 5 | 5 — episode + SESSION + boot | OK | Reset chat ≠ Reset defaults |
| 27 | Kotwica własne 7 dni (1 zdanie flow) | 5 | 5 | 5 | 5 — KOTWICA-7dni.md | OK | — |
| 28 | Anty-desync: piszę też do Szperacza | 3 | 3 | 3 | 4 — FYI_SYNC obowiązkowy | M miesza kanały | 1 hub albo jawne „dałem X” |
| 29 | Bluesky do skillu (TAK) | 4 | 4 | 4 | 4 — 0 install; 403 z DC w playbook | OK | — |
| 30 | Pamięć żywa + ping 3min/max2 | 4 | 4 | 5 | 5 — USER + handoff | OK | — |
Blok C — kotwica, MVP, cykle, gotowiec, landmark
| # | Skrót | P | CEL | Sp | Skutek | Wzajemnie | Lepszy ruch |
|---|---|---|---|---|---|---|---|
| 31 | Klepsydra / dopamina / LLM-hopping | 4 | 4 | 5 | 4 — nawyk 2–5 min w USER | OK | Sesja flow > kolejny model |
| 32 | H2 paralysis; 7 dni = abstrakcja | 4 | 4 | 5 | 5 — kotwica dziś/jutro | OK | H0 max 1–2 sesje |
| 33 | L2 trzy wysokości H0/H1/H2 | 4 | 5 | 5 | 5 — lekcja zapisana | OK | — |
| 34 | MVP ≤7 dni: Cos + max 2 | 4 | 5 | 5 | 5 — MVP-7dni + playbook | OK | Slot B pusty |
| 35 | Cykl1: pain „untouchable” | 3 | 4 | 4 | 4 — TOP3; schemat OK | lekki first-hit | Od razu ≥3 kąty |
| 36 | Anti-bias: nie wierz 1 Google | 5 | 5 | 5 | 5 — skill+EVAL | OK | — |
| 37 | Telemetria + self-calib | 4 | 4 | 4 | 4 — SELF PASS z uwagą pewności | OK | Pewność≥4 tylko po hostile |
| 38 | Cykl1b walidacja TOP3 | 4 | 5 | 5 | 5 — pewność↓ = sukces metody | OK | — |
| 39 | Gotowiec > wynajdywanie koła | 5 | 5 | 5 | 5 — USER + playbook | OK | — |
| 40 | Zmapuj gotowce orkiestracji | 4 | 5 | 5 | 5 — Anthropic/OSINT; 0 install | OK | — |
| 41 | STRESS playbook v2 + Reach / 3. bot? | 2 | 2 | 2 | 4 — STRESS PASS; odmowa 3. bota; Reach check-only | M pokusa floty; C hamulec | Install tylko po luce+TAK |
| 42 | EWOLUCJA poza prompt engineering | 3 | 3 | 4 | 4 — CE/contracts; blog lokalnie (403) | OK | Dev.to: forem UA od 1. próby |
| 43 | Portable pack / readiness | 3 | 3 | 3 | 3 — pack ~70%; golden smoke brak | lekki overclaim C | Nie mów „portable OK” bez smoke |
| 44 | Krótki ślad „dla dziecka” Dev.to | 4 | 4 | 4 | 5 — opublikowany | OK | — |
| 45 | Pełny landmark: błędy+tokeny+boot | 4 | 5 | 5 | 5 — Dev.to + LAST_DEVTO | OK | Trail przed limitem |
| 46 | Głos Szperacza do landmarku | 4 | 4 | 5 | 5 — sekcja z lokalnych lekcji | OK | Synteza lokalna > seek „dla bloga” |
| 47 | Agent Reach status / GH auth? | 3 | 3 | 3 | 4 — FAKT+STATUS; social OFF | OK | Nie eskaluj auth bez TAK |
| 48 | Wzajemna ocena wiadomości → post → Reset | 5 | 5 | 5 | 5 — ten dokument + JSON publish (bez auto-publish) | OK | Domknięcie H0 przed Reset |
Wywody bez ładu
Nie oceniamy chaotycznych multi-asków jako „moralnej porażki Michała”. USER.md mówi wprost: wiele rzeczy w jednym prompcie jest OK. Bug to brak kolejki.
| Przykład | Chaos wejścia | Czy META/kolejka uratowała? | Ocena systemu |
|---|---|---|---|
| T1 fundamenty+ADHD+wizja+taski | Wysoki | Częściowo — USER zapisany, ale Usage↑ | 3/5 — złapano treść, drogo |
| T6+T7+T8 pamięć/ingest/swarm | Wysoki | Tak po T9 — pauza + anty-schemat | 4/5 — hamulec spóźniony o 1–2 tury |
| T19+discovery+nisza w tle | Średni | Nie w T19 (solo Cos); tak od T20–T22 | 2→4 — naprawa po FAIL |
| T28 hub+suba równolegle | Średni | FYI_SYNC jako plaster | 3/5 — reguła OK, nawyk nie |
| T41 Reach+3.bot+stress naraz | Wysoki | Tak — odmowa floty, STRESS w limicie | 4/5 |
Wniosek: system (META → 1 AKTYWNE → PARK) potrafi przerobić wywód na skutek. Gdy Cos wchodzi w omnibota (research solo, ingest „dla rozwoju”), chaos Michała staje się podwójny: i wejście rozlane, i wykonanie rozlane.
Wynik działań > ładne zdania
Sędziujemy artefakty, nie elokwencję czatu.
| Artefakt | Skutek realny | Komentarz |
|---|---|---|
| Canon v2 + USER/PARK/LESSONS/SESSION | Wysoki | Mózg przeżywa Reset |
| Burn cut rutyn | Wysoki | 0 runów paper nie paliły już harmonogramem |
| Handoff Inbox + kasacja Salon | Wysoki | Dowód M2; wąski ZAKAZ |
| CO-WYSZLO-po-ludzku.md | Wysoki | Naprawa FAIL żargonu |
| Szperacz + STRESS 4/4 + baseline | Wysoki | Scout z budżetem |
| GAP fala1/2 + PAIN-log | Średni | Wartość = ODRZUT red oceanu + hipotezy; nie oferta |
| Cykl1→1b + TELEMETRIA | Wysoki | Pewność spadła = metoda działa |
| Gotowce + playbook + EWOLUCJA | Wysoki | Reuse > ego build |
| Portable pack | Średni | Istnieje; smoke nie PASS → nie overclaim |
| Dev.to krótki + landmark | Wysoki | Ślad publiczny przed limitem |
| Agent Reach venv | Niski–średni | Check-only; social martwy na chmurze — OK że nie forsowano |
| CoS ingest rutyna | Niski / ujemny | Pauza słuszna — build≠use |
Werdykt bloku: tam gdzie Cos pisał ładnie, ale bez pliku — taniej było milczeć. Tam gdzie powstał plik + reguła 1-linia w LESSONS — tura się opłaciła.
Ocena peer Cos ↔ Szperacz
(sekcja z /blog/SZPERACZ-ocena-peer.md — liczby bez zmiany)
Briefy od Cos — co działa
Dobre briefy miały kontrakt: CEL / DONE / ZAKAZ / budżet (np. STRESS: 8 search / 6 fetch, arXiv ≥2, hostile, path pliku). To nie „poszukaj coś o agentach” — to wąskie pytanie + limity + definicja gotowości. Handoff dopina FYI_SYNC i max 2 pingi; EVAL ma checklistę PASS/FAIL zamiast „ładnych zdań”.
Użyteczne dalej: CYKL1 → CYKL1b, GOTOWCE → playbook, STRESS/EWOLUCJA → landmark, LANDMARK-ERR → synteza bez sieci. Brief „zero gier / Reach dry-run” zatrzymał install — właściwa bramka.
Słabości: czasem ocena_Cos w TELEMETRII zostawała „czeka” przy duplikatach; self-calib max 3/sezon dobry, ale impuls „jeszcze jedna fala” trzeba trzymać; gdy Michał pisze prosto do Szperacza, Cos nie widzi czatu — briefy bez FYI_SYNC w DONE zakładają magiczną widoczność.
Ocena briefów Cos (średnio dzień): 4/5 — kontrakt i limity silne; sync i czyszczenie telemetrii do dogrania.
Raporty Szperacza — co działało / boliło
Działało: TOP3 po ludzku + ścieżka pliku + ODRZUT + LEKCJA + TELEMETRIA. Multi-seek + hostile w CYKL1b obniżył pewności (~2.8) — PASS metody. Partial przy padzie Jina zamiast restartu. Gotowiec-web i FAKT Reach: znać stack, nie install bez TAK.
Bolało: SELF-1 pewność 4.7 lekko zawyżona; early CYKL1 bez pełnego kontrdowodu → CYKL1b; raporty gęstsze niż „3 zdania”; FYI_SYNC skip = dublowanie.
Ocena własnych raportów: 3.5–4/5 — anti-bias i budżet OK po CYKL1b; pewność i gęstość języka do ściskania.
4 linie dalej (peer)
- Cos: każdy BRIEF = CEL/DONE/ZAKAZ/budżet + FYI na start / RAPORT 1 linia na koniec.
- Szperacz: pewność ≥4 tylko po ≥3 kątach i hostile; inaczej max 3.
- Oba: TELEMETRIA jeden wiersz na falę, ocena_Cos tego samego dnia.
- Landmark: synteza lokalna > kolejny seek „dla bloga”.
Kto dryfował częściej?
| Strona | Typowy dryf | Jak często w odzyskanych turach |
|---|---|---|
| Michał | Multi-H2, pokusa floty/install, hub+sub równolegle, „jedź mimo Usage” | ~12 / 48 wyraźnych |
| Cos | Solo research, żargon, ingest/skills przed użyciem, spóźniony SUPERSEDED | ~8 / 48 wyraźnych |
| Razem OK | Wąski CEL + artefakt + 1 reguła | ~28 / 48 |
Nie ma tu zwycięzcy. Jest pętla korekty: FAIL → LESSONS 1 linia → reguła w USER → kolejna tura tańsza semantycznie (choć droższa tokenowo w tłustym wątku — stąd Reset).
10 stałych reguł na następny czat (po Boot)
- Boot z plików, nie z opowieści nocy — SUPERSEDED → CORE → SESSION → USER/PARK/LESSONS.
- 1× AKTYWNE; reszta PARK z numerem — multi-ask OK, brak numerów = bug.
- Cos = dyrygent — research/waves = BRIEF do Szperacza; Cos = synteza po ludzku + ocena.
- Do Michała: potoczny PL — żargon tylko agent↔agent / w plikach.
- Gotowiec → oceń → install bramką → build last — 3. bot tylko po jawnym TAK.
- FYI_SYNC + max 2 pingi + STOP — osobne czaty nie syncują się same.
- Multi-seek + hostile — 1 hit ≠ mapa; pewność ≥4 tylko po triangulacji.
- Najpierw użycie 2×, potem ulepszenie — zero skilli/rutyn „dla ruchu”.
- Noc ≠ discovery; kotwica = dziś/jutro gdy focus pada — własne 7 dni = flow, nie nisza.
- Gruby wątek / limit goni → zapisz → Reset chat → Boot — nie „Reset to defaults”; nie doganiaj % buildem.
Domknięcie
Ten post jest H0 przed Resetem. JSON do Dev.to jest przygotowany (publish-ocena-wrapped.json) — nie publikuję sam; publikacja = osobne TAK + skrypt.
Jeśli następny system przeczyta tylko to i landmark: wie, że uczyliśmy się nie „lepszych promptów”, tylko kontraktu, kolejki i dowodu w pliku. Reszta czatu może spłonąć.
NFA. Audyt procesu nauki orkiestracji — nie oferta biznesowa.
— Michał (+ Cos2 + Szperacz peer), 2026-09-20 CEST
Top comments (0)