
Remek Kinas
@KinasRemek • 9,970 subscribers
AI Researcher | https://t.co/OVgxFgLghg | Kaggle Grand Master
Shorts
Videos

Fable 5.1 - Chain Reaction Machine (mój standardowy test powtarzany dla wszystkich nowych modeli typu frontier). Tomek Tomasz Jetka mówi, że ma 95% odmów. U mnie tak samo - zadania biologiczne oraz optymalizacja zadań AI/ML - wszystko odmówił. No to uruchomiłem go na "najbardziej", jak przystało na frontier model, zaawansowanego zadania jakim jest stworzenie UI (choć do tego to spokojnie wystarczą tańsze modele, bez ograniczeń) dla symulacji zrozumienia prostych zasad świata naturalnego. Ogólnie jeśli chcesz napisać, że model jest najmocniejszy taktyka jest prosta - zablokuj go na najtrudniejszych zadaniach. Efekt? Jeden (słownie 1 prompt, jedno zadanie) i wypalone 43% tygodniowego limitu Fable 5.1 !!!! Efekt - zobaczcie sami - pierwsza część video, dla porównania w drugiej daję gpt-5.6-sol. 1⃣ Fable 5.1 (Claude Code) Total cost: $29.14 Total duration (API): 1h 18m 14s Total duration (wall): 1h 36m 41s claude-fable-5-1: 3.2k input, 356.4k output, 7.7m cache read, 468.1k cache write ($29.14) 2⃣ gpt 5.6-sol (Codex) - extra-high Estimated total cost: $2,71 Token usage: total=117 989 input=79 695 (+ 4 072 576 cached) output=38 294 (reasoning 14 271) Total duration: 25m 23s Liczby raportowane przez narzędzia Codex i Claude Code. GPT‑5.6 Sol w Codex był zdecydowanie optymalniejszy ekonomicznie: - kosztował około 90,4–90,7% mniej, - był około 10,5 raza tańszy, - zużył około 9,3 raza mniej raportowanego outputu. Różnica kosztu wynosi około $26,4. Oznacza to, że Fable byłby ekonomicznie korzystniejszy dopiero wtedy, gdyby dzięki lepszemu rezultatowi oszczędził dodatkowo mniej więcej: - 32 minuty pracy człowieka wycenianej na $50/h, - 16 minut przy $100/h, Jeśli akceptujemy rozwiązania i przyjmujemy, że jakościowo są takie same to GPT-5.6 wygrywa ze znaczą przewagą.
Remek Kinas11,238 views • 1 day ago

Zobaczcie, co przywiózł do mnie kurier. Co za premiera! 🥰Z8 Fury G5 z czterema (4x) kartami Blackwell - 4x Nvidia RTX PRO 6000 Blackwell Max-Q. Najsilniejsza workstacja AI na świecie! 4x96GB = 384GB vRAM :) pod biurkiem. 🙏 Dziękuję HP Inc Poland za wybranie mnie jako pierwszego do testów tej niesamowitej stacji roboczej. Macie jakieś pomysły na testy? #HP #ZbyHP #HPIncPolska #StacjeRoboczeHP [płatna współpraca]
Remek Kinas257,420 views • 1 year ago

Opus 5 - to zobaczmy co się dzieje na naszym standardowym teście ... ✻ Cooked for 2h 4m 50s 🤡 ✻ 10.6k input, 521.2k output, 62.1m cache read, 1.1m cache write ($55.10) 🤭 Więc ogólnie kosmos jeśli chodzi o czas, koszt, eco (liczbę generowanych tokenów). Efekt jednak dobry.
Remek Kinas34,496 views • 1 month ago

W Polsce ekscytacja „Oze sr…e”, a w San Francisco i okolicach „Waymo sr…jmo”. Śmieję się bo mój wniosek po jeżdżeniu tym wynalazkiem jest taki, że wolę niekiedy oddać się robotowi, autonomii niż człowiekowi. Ale po kolei … Autonomia wtopiła się u ulice Doliny Krzemowej. Waymo ale też inne (na razie w fazie testów) to bardzo częsty widok. W zasadzie nic specjalnego …. Widzisz albo samochód widmo - ktoś siedzi zwykle z tyłu, albo kompletne widmo … wóz samotnie jadący gdzieś … gdzie? On tylko wie. Oglądam te stwory w różnych sytuacjach - pusta ulica, zmiana organizacji ruchu i kompletny chaos przed koncertem, ruch uliczny i centrum miasta. We wszystkich tych punktach czasoprzestrzeni radzą sobie wyśmienicie. Wzorce, które łatwo dostrzec: zdecydowanie (niektórzy mówią agresja) - starają się wcisnąć na pasy między przechodniami, chcą zmieniać pasy ruchu, wykorzystują różne takie luki, widzą przestrzennie ale też czytają (napisy na drodze - gdzie zostawić miejsce wolne), przepuszczają bardzo kulturalnie samochody włączające się do ruchu (no ja bym kiwnął ręką w podziękowaniu za takie ustąpienie), współpracują. Ten ostatni element jest ciekawy - tworzą autonomiczne swarmy. Wykorzystują mądrość grupową. Widziałem takie sytuacje gdzie Waymo między sobą współgrały i przepuszczały się na wzajem. To robiło ogromne wrażenie jak same się organizowały. Z punktu widzenia AI - fajna fuzja różnych modalności - LiDAR, wizja, radar, czujki dźwięku, świadomość grupowa pojazdów.
Remek Kinas57,505 views • 5 months ago

AGI a'la Fable i Sonnet 5 - chwila refleksji i otrzeźwienia moi drodzy. Oceńcie sami. Bez marketingu. Na chłodno. Standardowy test, który przeprowadzam by przetestować Frontier model - rozumienie świata (wycinek świata) - Chain Reaction Machine. Czyli planowanie, przewidywanie konsekwencji, akcja-reakcja. Nic nie narzucam ... po prostu daję zadanie by model/system udowodnił, że rozumie jak działa świat. By było łatwiej daję zadanie programistyczne (by wszystko dało się dokładnie zaprojektować i obliczyć). Nie jakieś tricki z cyklu liczenie pojedynczych literek wykorzystujące niedoskonałości techniczne elementów modelu (tokenizację). Nie jest to test idealny ale pokazuje sporo na temat tzw. "AGI" (model świata, wiedza o nim, zdolność kodowania, umiejętność tworzenia UI, samoświadomość tego co stworzył itd.). 💰Fable 5: 1 godzina 29 minut 56 sekund 34.61 USD claude-haiku-4-5: 507 input, 14 output, 0 cache read, 0 cache write ($0.0006) claude-fable-5: 10.3k input, 259.3k output, 14.3m cache read, 363.8k cache write ($34.61) 🤒Sonnet 5: 19 minut 3.82 USD clode-haiku-4-5: 507 input, 14 output, 0 cache read, 0 cache write ($0.0006), claude-sonnet-5: 9.2k input, 101.4k output, 3.1m cache read, 222.3k cache write ($3.82)
Remek Kinas23,833 views • 2 months ago

Kolejny etap software engineering’u 🤩 Brak kodu!!! Zamiast dawać repo z kodem przekazywać repo z wymaganiami - product requirements documentation, architecture requirements, standards w etc. Wszystko zapisane w markdown. Zero kodu. Niech odbiorca sam sobie zakoduje :) Wczoraj wieczorem skończyłem właśnie pisać takie repo (Antec - personalny system agentowy - integruje najlepsze praktyki z 16 przebadanych systemów typu Clawd). W repo jest TYLKO komplet "ludzkich" dokumentów (jak kartki zapisane z koncepcją biznesową). Bez implementacji. Założenie jest takie, że klient pobiera repo, modyfikuje pliki wymagań markdown pod swoje potrzeby (dodanie, zmiana wymagań, wymagania technologiczne - typy baz danych, język programowania, jak ma być wdrażane np. docker czy w usłudze chmurowej). Uruchamiamy Claude Code (Codex) i system ten developuje całość do wdrożenia i utworzenia CD/CI. Puściłem dzisiaj rano implementację. Claude Code chodzi w 100% autonomicznie. Zarządza contextem przez podział wszystkiego na epic oraz user stories (tak opisałem wymagania). Fazy przekazywane są za pomocą tzw. handoverów (między fazami implementacji) - plików rozgrzebanej pracy (chociaż zakładam jak w scrum, że funkcjonalność jeśli podjęta musi być zaimplementowana, przetestowana - najwyżej może być różnica w zakresie implementacji np. 80%). Oprócz tego oczywiście wszystko opisane w Dodatkowo pliki (jako lessons learned) oraz plan (do planowania kolejnych sprintów). Stan na teraz: - liczba linii kodu - 16.006 l- iczba testcasów (trzy poziomy - komponent, integracja, e2e) - 283 - work in progress - zaimplementowano fazę 1 na 4 - planowane oddanie produktu jutro nad ranem (tak szacuję) Jak skończy implementację to zdam Wam raport ile było poprawek. Cel jest taki by doprowadzić do sytuacji gdzie kopiujecie repo, robicie zmiany, uruchamiacie klienta (Codex, Claude) po jakimś czasie otrzymujecie finalny produkt. Zobaczymy czy wyjdzie.
Remek Kinas52,067 views • 6 months ago

🇵🇱 Dzisiaj stworzyłem Claude Code Math Prover (13-minutowy film pokazuje jak to działa). Claude Code Opus 4.6 orkiestruje cały przepływ pracy. Deleguje podzadania do różnych agentów: - OpenAI Codex 5.3 (badacz, rozwiązuje, recenzent) - jak widać można używać równolegle i Codex'a i Claude Code. - Claude Code (planista, rozwiązuje). - Wykorzystuje MCP poprzez lean-lsp-mcp dowodzenie twierdzeń za pomocą Lean. Używam Team Agents z tmux do pokazania jak Claude Code deleguje zadania do Codex i do siebie ale do subagentów. SKILL - codex - napisałem skilla do orkiestracji Codex'a -------------------- 🇬🇧Claude Code Math Prover (13-minute video) I made today. Claude Code Opus 4.6 orchestrates the workflow. It delegates subtasks to different agents: - OpenAI Codex 5.3 (researcher, solver, reviewer) - so we can use both solution Codex ad Claude Code - Claude Code (planner, solver). - It uses MCP via lean-lsp-mcp, which enables agentic interaction with the Lean theorem prover. I use Claude Code team agents for this task so you can see how Claude Code delegate all task. SKILL - I wrote skill for codex orchestration
Remek Kinas46,691 views • 6 months ago

Grand challenge (chain reaction) - Hermes Agent i wszystko co ma dostępne pod maską. Ten sam prompt. Wszystkie modele wykonują to samo zadanie w tym samym środowisku agentowym - wyniki jeszcze dzisiaj. Modele: - gpt-5.6-sol - deepseek-v4-pro - claude fable 5 - claude opus 4.8 - kimi-k3 - muse-spark-1.1 - glm-5.2 - fugu ultra - grok 4.5
Remek Kinas11,277 views • 1 month ago

🔥Sakana Fugu-ultra 🟩OpenAI GPT 5.5 🟩GLM 5.2 🟩Opus 4.8 TASK Create a high-quality single HTML file simulation of a Rube Goldberg / chain-reaction machine. The simulation should run automatically from start to finish without user input.The goal is to demonstrate whether the coding model understands real-world physics well enough to create believable cause-and-effect behavior - Rube Goldberg / chain-reaction machine. The scene should show a small physical world where objects interact through realistic mechanics: gravity, collisions, momentum transfer, ramps, pulleys, levers, springs, falling objects, rolling balls, dominoes, and water or particles if possible. The simulation should include: * A ball rolling down a ramp * Dominoes falling one after another * A lever or seesaw transferring force * A spring launcher * A pendulum or swinging weight * A pulley or elevator mechanism * Falling objects affected by gravity * Objects with different mass, friction, and bounce * Clear visual labels explaining what physical law is being demonstrated * A progress timeline showing the current stage of the chain reaction * Automatic reset/replay after the sequence ends The simulation should visually demonstrate: * Gravity * Momentum transfer * Conservation of energy * Friction * Torque * Elastic potential energy * Collision response * Cause and effect The model should not just animate objects on fixed paths. Objects should appear to interact physically. For example, the ball should knock over dominoes, dominoes should push a lever, the lever should launch another object, and so on. Evaluation criteria 1. Does the simulation run automatically without user input? 2. Do objects interact through believable physical cause and effect? 3. Are physical laws represented correctly? 4. Are labels and UI helpful? 5. Is the animation smooth and stable? 6. Does the code avoid fake-looking hardcoded movement? 7. Does the scene reset cleanly?
Remek Kinas14,146 views • 2 months ago

20 minut porządnego w pełni autonomicznego 🕵️🤖🤖🤖🤖 kodowania za pomocą AGENT TEAMS (wszystkie sesje agentów równolegle widać dzięki tmux - super się to ogląda jak ze sobą współpracują). Robi niesamowite wrażenie 😍🥰 Claude Code Opus 4.6 😻 5 agentów tworzących grę TETRIS ... (architekt, developer, tester ...) łącznie z automatycznymi testami gry w przeglądarce (agent sam gra i sprawdza poprawność implementacji funkcjonalności). Dzisiaj to tak wygląda. Za pół roku ... nawet nie chcę myśleć co będzie. Siedziałem przed komputerem i tylko obserwowałem. Jedna uwaga? Pewnie rozwiązanie to wymaga optymalizacji (dużo tokenów idzie) ale ... możliwość tworzenia agentów w locie na podstawie promptu - SZOK! Jutro dorzucę jeszcze definicję subagentów. skills tylko do Plywright - reszta w czystym Claude Code z włączoną eksperymentalną funkcją agent teams i automatycznym zatwierdzaniem.
Remek Kinas29,904 views • 6 months ago

Jak szukacie czegoś na weekend i na wiele, wiele nocy to polecam coś nad czym przesiedziałem ostatnie ... 2-3 miesiące. MADL - Model Architecture Description Language. #1/2 16 architektur modeli, 197 rodziałów książki opisujących różne aspekty architektur modeli językowych i multimodalnych, formalizacja opisu architektur modeli językowych, możliwości porównań architektur itd. Moim zdaniem jest to obecnie największe i najpełniejsze źródło wiedzy na temat archtektur modeli jakie stworzono. Koncepcja, pomysł, wybór tematów - człowiek w 100%. Pisanie artykułów system agentowy wraz z pętlą samokorekty, systemem genetycznym do zmiany promtów itd. Uwaga! "Work in progress" - mogą być jeszcze błędy, nieścisłości. Przewiduję, ze całość zakończę za jakieś 2-3 miesiące (wersja już całkowicie po korektach). Postanowiłem jednak dzisiaj to udostępnić by zbierać info zwrotne, poprawiać itd. Link w pierwszym poście pod.
Remek Kinas21,151 views • 4 months ago

Jak ze stacji roboczej HP - Z6 zrobić środowisko do vibe codingu? Przepis jest prosty - stacja robocza z 1x GPU (akurat moja posiada 2x Nvidia RTX PRO 6000 Blackewell Max-Q), lokalna instalacja vllm'a albo SGLang, najnowszy model Qwen3-Coder-30B-A3B-Instruct i żegnajcie limity, ograniczenia, płatności. 100% lokalnie, bez przekazywania danych, bezpiecznie. Zobaczmy, czy dzięki takiej stacji kilka osób jest w stanie pracować lokalnie. Oczywiście opencode. #HP #ZbyHP #HPIncPolska #StacjeRoboczeHP [płatna współpraca]
Remek Kinas21,533 views • 6 months ago

Apel ✅🌐 Artemis II - dzisiaj jedno z największych wydarzeń jakie mogą inspirować młodych, nas wszystkich do tego by świat czynić lepszym, ciekawszym, bardziej wartościowym. By promować naukę, inżynierię, to co człowiek potrafi stworzyć a nie to co człowiek potrafi zniszczyć. Zrobiłem przegląd 4 najważniejszych mediów internetowych Onet, Gazeta Wyborcza, Rzeczpospolita, Wirtualna Polska - pytanie brzmiało ile poświęcono dzisiaj przestrzeni internetowej dla Artemis II. A mówi się, że media kształtują nasze społeczeństwo .... Onet Wiadomości Gazeta Wyborcza.pl Rzeczpospolita Wirtualna Polska dajcie proszę info o harmonogramie i o wydarzeniu - poproszę - wziąłem poniższe wpisy od Hubert Kijek Dzisiejsze rekordy: - Pobicie rekordu odległości Astronauci znajdą się dalej od Ziemi niż jakikolwiek człowiek w historii - Największe zbliżenie Oriona do Księżyca Punkt kulminacyjny manewru, tzw. peryselenium - Orion osiąga maksymalną odległość od Ziemi Punkt na trajektorii lotu - Orion wchodzi w strefę zaćmienia Słońca przez Księżyc Hubert Kijek Maciej Kawecki - This Is IT Łukasz Olejnik Artur Kurasiński ⚡ Tomek Czajka Andrzej Dragan Bartosz Naskręcki Piotr Sankowski Sławosz Uznański-Wiśniewski Patrycjusz Wyżga Space24
Remek Kinas16,851 views • 5 months ago