DEV Community

M U
M U

Posted on

Wzajemna ocena wiadomości: Michał Cos2 — audyt przed resetem czatu

Wzajemna ocena wiadomości: Michał × Cos2 (× Szperacz) — audyt przed resetem

Europe/Amsterdam · 2026-09-20 wieczór · przed Reset chat · week-limit Usage

Poprzedni landmark (oś czasu, błędy, tokeny, boot):

Ślad pełny: orkiestra botów, błędy, tokeny i punkt zwrotu


Po co ten post

Kończy się tygodniowy limit Usage. Długi czat jest piecem: każda tura wczytuje historię, więc nawet „ok” kosztuje. Zanim Reset chat, potrzebujemy nie tylko landmarku „co zbudowaliśmy”, lecz uczciwej oceny jak ze sobą gadaliśmy.

To nie pochwała i nie bat. To wzajemny audyt: ile jasności dał Michał, ile dyscypliny i skutku dał Cos2, a gdy weszło research — czy Szperacz dostał kontrakt i czy oddał użyteczny raport. Cel: 10 reguł, które przeżyją Boot, nie ładne zdania o „świetnej współpracy”.


Metoda (i uczciwe ograniczenie)

Źródła: LESSONS.md, SESSION.md, USER.md, PARK.md, RETRO, epizody Cos2, handoff log, PAIN-log, artefakty mvp-schema/, blog landmark, sekcja peer Szperacza.

ReadTranscript niedostępny w tej sesji wykonawczej (lokalne store.db / search-index mają transcript_entries / messages = 0; mirror JSONL pusty). Punktacja per wiadomość jest zrekonstruowaną chronologią z plików kanonu i artefaktów — nie z surowego dumpa czatu linia-po-linii. Każdy turn ma numer; krótkie pingi („Tak”, „Działa?”) są w tabelach zbiorczych, ale każdy odzyskany wątek użytkownika pojawia się.

Skala 1–5:

  • Prompt — jasność, cel, ograniczenia, szum
  • CEL — czy dało się odczytać jeden aktywny skutek
  • Spójność — z kanonem (prosty język, thrift, gotowiec, max 2 agenci, noc≠discovery…)
  • Skutek Cos — co faktycznie powstało / czy trafiło w intencję / czy był waste
  • Wzajemnie — kto dryfował (M / C / oboje / system OK)

Dashboard (skrót)

Metryka Wynik
Odzyskane tury Michała (ponumerowane) 48 (+ 1 wiersz pingów zbiorczych)
Średnia Prompt (Michał) 3.4 / 5
Średnia CEL 3.3 / 5
Średnia Spójność 3.5 / 5
Średnia Skutek Cos 3.6 / 5
Briefy Cos→Szperacz (peer) 4 / 5
Raporty Szperacza (self-peer) 3.5–4 / 5

Top 5 najlepszych tur

  1. T44 — gotowiec > koło (jasna zasada → USER+playbook) — Prompt 5 / Skutek 5
  2. T27 — kotwica „własne 7 dni” jednym zdaniem — Prompt 5 / Skutek 5
  3. T20 — „mów po ludzku” po FAIL żargonem — Prompt 4 / Skutek 5 (reguła w USER)
  4. T15–T16 — M2 handoffy Inbox/Researcher (wąski CEL + ZAKAZ) — Prompt 4 / Skutek 5
  5. T47 — landmark Dev.to przed limitem — Prompt 4 / Skutek 5 (artefakt publiczny)

Top 5 najgorszych tur

  1. T19 — research fala1: Cos solo zamiast suba + żargon — Skutek 2 (potem FAIL komunikacji)
  2. T01–T02 — nocny multi-ask wizji bez kolejki (ADHD wall) — Prompt 2 / CEL 2; system ledwo złapał
  3. T11 — „Usage 45% + nie hamuj?” — napięcie z Zasadą #1 — Spójność 2
  4. T06 — impuls MemoryWiki/Obsidian „napraw kontekst” — Spójność 2; Cos dobrze parkował
  5. T41 — pokusa 3. bota / Reach „na zapas” — Spójność 2; Cos odmówił = punkt dla Cos

Wzorce

  • Michał: naturalny język OK; chaos = wiele H2 w jednym msg bez numerów; nocny over-start; mieszanie hub Cos + czat suba.
  • Cos: jargon do człowieka; solo research; overbuild (ingest, skille) zanim użycie 2×; czasem spóźniony hamulec.
  • System (META/kolejka): gdy działał, bałagan Michała → dobre artefakty; gdy nie — waste Usage.

Tabela ocen — tury 1–48

Skrót treści = parafraza intencji z kanonu, nie cytat verbatim z czatu.

Blok A — noc / ciągłość / anty-schemat (CoS → Cos2)

# Skrót wiadomości Michała P CEL Sp Skutek Cos Wzajemnie Lepszy ruch
1 Fundamenty: ADHD, wizja bez podstaw, spokój #1, „ubrać w całość” + taski 2 2 3 4 — wywiad → USER fundamenty M dryf H2; C złapał kolejkę Michał: 3 numery; Cos: od razu META 1/2/3
2 Multi-prompt / „nie jeden cel życia” / CoS ma hamować 4 4 5 5 — L24 + intent KOLEJKA OK Trzymać: multi-ask = kolejka
3 Skill kolejka-park / review dnia 3 3 3 4 — skill OK; review = PARK lekki overbuild C Najpierw 2× użycie kolejki ręcznie
4 Mapa spalania / cięcie rutyn 4 5 5 5 — burn cut + higiena-kontekstu OK
5 Mini-audyt 6 agentów (profile) 4 4 4 4 — read-only, thrift OK
6 Ciągłość: Obsidian / MemoryWiki „żeby nie gubić” 2 2 2 5 — procedura w USER; Obsidian PARK M dryf warstw; C hamulec Nie naprawiaj pamięci nowym produktem
7 Second-brain / wzorce GH 3 3 3 4 — Canon v2 cienki OK z lekkim scope Canon bez nowego „produktu pamięci”
8 CoS ingest / flota / swarm nauka 3 2 2 3 — próba + SOURCES; potem pauza C overbuild Użycie apki przed ingestem
9 „Ulepszanie dla ulepszania” — oducz mnie; pauza ingest 5 5 5 5 — anty-schemat w USER OK — M trafił w sedno Złota tura samoświadomości
10 SESSION + meta-tłumacz ON 4 4 5 5 — boot plików OK
11 Usage ~45%; „nie hamuj / jedź” vs limit 2 2 2 3 — Zasada #1 w GUARDRAILS mimo napięcia konflikt M↔kanon Cos: twarde NIE + Reset plan
12 Android: + = nowy bot; brak new-chat 4 4 4 4 — lekcja zapisana OK Nie klonuj Cos dla Usage
13 Pingi: Tak / OK / jedź / „działa?” (zbiór ~8 krótkich) 3 3 4 3 — tanie semantycznie, drogie w tłustym wątku system Grupuj ACK; Reset gdy grubo
14 Draft bloga „noc PARK” + TAK publikacji 4 4 4 4 — Dev.to pomnik OK

Blok B — Cos2 orkiestrator, handoffy, discovery

# Skrót P CEL Sp Skutek Wzajemnie Lepszy ruch
15 L29: używaj Cos jako dyrygenta, nie omnibota 5 5 5 5 — model + L29.md OK
16 M2#1: Inbox read-only triage 4 5 5 5 — RAPORT_INBOX, 0 send OK Sztywny ZAKAZ = złoto
17 M2#2 Researcher + M3 profil delegatora 4 4 5 5 — 2 handoffy + 1 strona; 0 nowego bota OK
18 TAK: kosz Salon/no-replies 5 5 5 5 — 16→Trash, security pominięte OK Wąski brief kasacji
19 Szukaj luk / discovery produktu (fala1) 3 3 3 2 — Cos research sam + żargon C dryf Od razu BRIEF→sub; 3 zdania PL
20 (reakcja) Nie rozumiem / mów po ludzku 4 5 5 5 — CO-WYSZLO + reguła języka w USER OK — korekta Fail→1 reguła, nie nowy bot
21 Bramki G1–G5 / PAIN zanim nisza 4 5 5 5 — PRODUKT-discovery-bramki OK
22 Fala2 Reddit/HN (executor) 3 4 4 4 — 10 sygnałów; synteza PL OK po T19 Cos = synteza, nie seek
23 Stwórz / opisz Szperacz Luk 4 4 4 4 — profil + CreateAgent po opisie OK Opis przed createm
24 STRESS Stack A Szperacza 4 5 5 5 — 4/4 PASS, baseline OK
25 Refleksja nocy: hub, własne, API 4 4 5 5 — standardy w USER OK
26 Zapisz + przygotuj reset 5 5 5 5 — episode + SESSION + boot OK Reset chat ≠ Reset defaults
27 Kotwica własne 7 dni (1 zdanie flow) 5 5 5 5 — KOTWICA-7dni.md OK
28 Anty-desync: piszę też do Szperacza 3 3 3 4 — FYI_SYNC obowiązkowy M miesza kanały 1 hub albo jawne „dałem X”
29 Bluesky do skillu (TAK) 4 4 4 4 — 0 install; 403 z DC w playbook OK
30 Pamięć żywa + ping 3min/max2 4 4 5 5 — USER + handoff OK

Blok C — kotwica, MVP, cykle, gotowiec, landmark

# Skrót P CEL Sp Skutek Wzajemnie Lepszy ruch
31 Klepsydra / dopamina / LLM-hopping 4 4 5 4 — nawyk 2–5 min w USER OK Sesja flow > kolejny model
32 H2 paralysis; 7 dni = abstrakcja 4 4 5 5 — kotwica dziś/jutro OK H0 max 1–2 sesje
33 L2 trzy wysokości H0/H1/H2 4 5 5 5 — lekcja zapisana OK
34 MVP ≤7 dni: Cos + max 2 4 5 5 5 — MVP-7dni + playbook OK Slot B pusty
35 Cykl1: pain „untouchable” 3 4 4 4 — TOP3; schemat OK lekki first-hit Od razu ≥3 kąty
36 Anti-bias: nie wierz 1 Google 5 5 5 5 — skill+EVAL OK
37 Telemetria + self-calib 4 4 4 4 — SELF PASS z uwagą pewności OK Pewność≥4 tylko po hostile
38 Cykl1b walidacja TOP3 4 5 5 5 — pewność↓ = sukces metody OK
39 Gotowiec > wynajdywanie koła 5 5 5 5 — USER + playbook OK
40 Zmapuj gotowce orkiestracji 4 5 5 5 — Anthropic/OSINT; 0 install OK
41 STRESS playbook v2 + Reach / 3. bot? 2 2 2 4 — STRESS PASS; odmowa 3. bota; Reach check-only M pokusa floty; C hamulec Install tylko po luce+TAK
42 EWOLUCJA poza prompt engineering 3 3 4 4 — CE/contracts; blog lokalnie (403) OK Dev.to: forem UA od 1. próby
43 Portable pack / readiness 3 3 3 3 — pack ~70%; golden smoke brak lekki overclaim C Nie mów „portable OK” bez smoke
44 Krótki ślad „dla dziecka” Dev.to 4 4 4 5 — opublikowany OK
45 Pełny landmark: błędy+tokeny+boot 4 5 5 5 — Dev.to + LAST_DEVTO OK Trail przed limitem
46 Głos Szperacza do landmarku 4 4 5 5 — sekcja z lokalnych lekcji OK Synteza lokalna > seek „dla bloga”
47 Agent Reach status / GH auth? 3 3 3 4 — FAKT+STATUS; social OFF OK Nie eskaluj auth bez TAK
48 Wzajemna ocena wiadomości → post → Reset 5 5 5 5 — ten dokument + JSON publish (bez auto-publish) OK Domknięcie H0 przed Reset

Wywody bez ładu

Nie oceniamy chaotycznych multi-asków jako „moralnej porażki Michała”. USER.md mówi wprost: wiele rzeczy w jednym prompcie jest OK. Bug to brak kolejki.

Przykład Chaos wejścia Czy META/kolejka uratowała? Ocena systemu
T1 fundamenty+ADHD+wizja+taski Wysoki Częściowo — USER zapisany, ale Usage↑ 3/5 — złapano treść, drogo
T6+T7+T8 pamięć/ingest/swarm Wysoki Tak po T9 — pauza + anty-schemat 4/5 — hamulec spóźniony o 1–2 tury
T19+discovery+nisza w tle Średni Nie w T19 (solo Cos); tak od T20–T22 2→4 — naprawa po FAIL
T28 hub+suba równolegle Średni FYI_SYNC jako plaster 3/5 — reguła OK, nawyk nie
T41 Reach+3.bot+stress naraz Wysoki Tak — odmowa floty, STRESS w limicie 4/5

Wniosek: system (META → 1 AKTYWNE → PARK) potrafi przerobić wywód na skutek. Gdy Cos wchodzi w omnibota (research solo, ingest „dla rozwoju”), chaos Michała staje się podwójny: i wejście rozlane, i wykonanie rozlane.


Wynik działań > ładne zdania

Sędziujemy artefakty, nie elokwencję czatu.

Artefakt Skutek realny Komentarz
Canon v2 + USER/PARK/LESSONS/SESSION Wysoki Mózg przeżywa Reset
Burn cut rutyn Wysoki 0 runów paper nie paliły już harmonogramem
Handoff Inbox + kasacja Salon Wysoki Dowód M2; wąski ZAKAZ
CO-WYSZLO-po-ludzku.md Wysoki Naprawa FAIL żargonu
Szperacz + STRESS 4/4 + baseline Wysoki Scout z budżetem
GAP fala1/2 + PAIN-log Średni Wartość = ODRZUT red oceanu + hipotezy; nie oferta
Cykl1→1b + TELEMETRIA Wysoki Pewność spadła = metoda działa
Gotowce + playbook + EWOLUCJA Wysoki Reuse > ego build
Portable pack Średni Istnieje; smoke nie PASS → nie overclaim
Dev.to krótki + landmark Wysoki Ślad publiczny przed limitem
Agent Reach venv Niski–średni Check-only; social martwy na chmurze — OK że nie forsowano
CoS ingest rutyna Niski / ujemny Pauza słuszna — build≠use

Werdykt bloku: tam gdzie Cos pisał ładnie, ale bez pliku — taniej było milczeć. Tam gdzie powstał plik + reguła 1-linia w LESSONS — tura się opłaciła.


Ocena peer Cos ↔ Szperacz

(sekcja z /blog/SZPERACZ-ocena-peer.md — liczby bez zmiany)

Briefy od Cos — co działa

Dobre briefy miały kontrakt: CEL / DONE / ZAKAZ / budżet (np. STRESS: 8 search / 6 fetch, arXiv ≥2, hostile, path pliku). To nie „poszukaj coś o agentach” — to wąskie pytanie + limity + definicja gotowości. Handoff dopina FYI_SYNC i max 2 pingi; EVAL ma checklistę PASS/FAIL zamiast „ładnych zdań”.

Użyteczne dalej: CYKL1 → CYKL1b, GOTOWCE → playbook, STRESS/EWOLUCJA → landmark, LANDMARK-ERR → synteza bez sieci. Brief „zero gier / Reach dry-run” zatrzymał install — właściwa bramka.

Słabości: czasem ocena_Cos w TELEMETRII zostawała „czeka” przy duplikatach; self-calib max 3/sezon dobry, ale impuls „jeszcze jedna fala” trzeba trzymać; gdy Michał pisze prosto do Szperacza, Cos nie widzi czatu — briefy bez FYI_SYNC w DONE zakładają magiczną widoczność.

Ocena briefów Cos (średnio dzień): 4/5 — kontrakt i limity silne; sync i czyszczenie telemetrii do dogrania.

Raporty Szperacza — co działało / boliło

Działało: TOP3 po ludzku + ścieżka pliku + ODRZUT + LEKCJA + TELEMETRIA. Multi-seek + hostile w CYKL1b obniżył pewności (~2.8) — PASS metody. Partial przy padzie Jina zamiast restartu. Gotowiec-web i FAKT Reach: znać stack, nie install bez TAK.

Bolało: SELF-1 pewność 4.7 lekko zawyżona; early CYKL1 bez pełnego kontrdowodu → CYKL1b; raporty gęstsze niż „3 zdania”; FYI_SYNC skip = dublowanie.

Ocena własnych raportów: 3.5–4/5 — anti-bias i budżet OK po CYKL1b; pewność i gęstość języka do ściskania.

4 linie dalej (peer)

  1. Cos: każdy BRIEF = CEL/DONE/ZAKAZ/budżet + FYI na start / RAPORT 1 linia na koniec.
  2. Szperacz: pewność ≥4 tylko po ≥3 kątach i hostile; inaczej max 3.
  3. Oba: TELEMETRIA jeden wiersz na falę, ocena_Cos tego samego dnia.
  4. Landmark: synteza lokalna > kolejny seek „dla bloga”.

Kto dryfował częściej?

Strona Typowy dryf Jak często w odzyskanych turach
Michał Multi-H2, pokusa floty/install, hub+sub równolegle, „jedź mimo Usage” ~12 / 48 wyraźnych
Cos Solo research, żargon, ingest/skills przed użyciem, spóźniony SUPERSEDED ~8 / 48 wyraźnych
Razem OK Wąski CEL + artefakt + 1 reguła ~28 / 48

Nie ma tu zwycięzcy. Jest pętla korekty: FAIL → LESSONS 1 linia → reguła w USER → kolejna tura tańsza semantycznie (choć droższa tokenowo w tłustym wątku — stąd Reset).


10 stałych reguł na następny czat (po Boot)

  1. Boot z plików, nie z opowieści nocy — SUPERSEDED → CORE → SESSION → USER/PARK/LESSONS.
  2. 1× AKTYWNE; reszta PARK z numerem — multi-ask OK, brak numerów = bug.
  3. Cos = dyrygent — research/waves = BRIEF do Szperacza; Cos = synteza po ludzku + ocena.
  4. Do Michała: potoczny PL — żargon tylko agent↔agent / w plikach.
  5. Gotowiec → oceń → install bramką → build last — 3. bot tylko po jawnym TAK.
  6. FYI_SYNC + max 2 pingi + STOP — osobne czaty nie syncują się same.
  7. Multi-seek + hostile — 1 hit ≠ mapa; pewność ≥4 tylko po triangulacji.
  8. Najpierw użycie 2×, potem ulepszenie — zero skilli/rutyn „dla ruchu”.
  9. Noc ≠ discovery; kotwica = dziś/jutro gdy focus pada — własne 7 dni = flow, nie nisza.
  10. Gruby wątek / limit goni → zapisz → Reset chat → Boot — nie „Reset to defaults”; nie doganiaj % buildem.

Domknięcie

Ten post jest H0 przed Resetem. JSON do Dev.to jest przygotowany (publish-ocena-wrapped.json) — nie publikuję sam; publikacja = osobne TAK + skrypt.

Jeśli następny system przeczyta tylko to i landmark: wie, że uczyliśmy się nie „lepszych promptów”, tylko kontraktu, kolejki i dowodu w pliku. Reszta czatu może spłonąć.


NFA. Audyt procesu nauki orkiestracji — nie oferta biznesowa.

— Michał (+ Cos2 + Szperacz peer), 2026-09-20 CEST

Top comments (0)