Remek Kinas's banner
Remek Kinas's profile picture

Remek Kinas

@KinasRemek9,970 subscribers

AI Researcher | https://t.co/OVgxFgLghg | Kaggle Grand Master

Shorts

teraz testy lecą na omp (OH MY PI) ... testowałem na Codex, Hermes Agents, opencode, pi ... ten wzbudza nadzieje na świetne narzędzie - jak wasze doświadczenia?

teraz testy lecą na omp (OH MY PI) ... testowałem na Codex, Hermes Agents, opencode, pi ... ten wzbudza nadzieje na świetne narzędzie - jak wasze doświadczenia?

11,202 просмотров

Pierwszy test (u mnie standardowy) - GPT 5.6 SOL. Porównuję model do najlepszej obecnie wygenerowanej symulacji one-shot za pomocą Fugu Ultra. Oczywiście to pierwszy strzał ...

Pierwszy test (u mnie standardowy) - GPT 5.6 SOL. Porównuję model do najlepszej obecnie wygenerowanej symulacji one-shot za pomocą Fugu Ultra. Oczywiście to pierwszy strzał ...

13,753 просмотров

Optymalizuję ⚡️⚡️⚡️ więc … tradycyjnie już Windows - bye bye 👋 Fedora wleciała 💪👍💪 Benchmark dla DGX to 67 tok/sec dla GPT- OSS-20B 4bit. No to zobaczymy …. Platforma AMD w HP Z2 G1a. W środku AMD Ryzen™ Al Max+ 395 iGPU. #HP #ZbyHP #HPIncPolska #StacjeRoboczeHP [płatna współpraca]

Optymalizuję ⚡️⚡️⚡️ więc … tradycyjnie już Windows - bye bye 👋 Fedora wleciała 💪👍💪 Benchmark dla DGX to 67 tok/sec dla GPT- OSS-20B 4bit. No to zobaczymy …. Platforma AMD w HP Z2 G1a. W środku AMD Ryzen™ Al Max+ 395 iGPU. #HP #ZbyHP #HPIncPolska #StacjeRoboczeHP [płatna współpraca]

26,873 просмотров

Videos

KinasRemek's profile picture

Fable 5.1 - Chain Reaction Machine (mój standardowy test powtarzany dla wszystkich nowych modeli typu frontier). Tomek Tomasz Jetka mówi, że ma 95% odmów. U mnie tak samo - zadania biologiczne oraz optymalizacja zadań AI/ML - wszystko odmówił. No to uruchomiłem go na "najbardziej", jak przystało na frontier model, zaawansowanego zadania jakim jest stworzenie UI (choć do tego to spokojnie wystarczą tańsze modele, bez ograniczeń) dla symulacji zrozumienia prostych zasad świata naturalnego. Ogólnie jeśli chcesz napisać, że model jest najmocniejszy taktyka jest prosta - zablokuj go na najtrudniejszych zadaniach. Efekt? Jeden (słownie 1 prompt, jedno zadanie) i wypalone 43% tygodniowego limitu Fable 5.1 !!!! Efekt - zobaczcie sami - pierwsza część video, dla porównania w drugiej daję gpt-5.6-sol. 1⃣ Fable 5.1 (Claude Code) Total cost: $29.14 Total duration (API): 1h 18m 14s Total duration (wall): 1h 36m 41s claude-fable-5-1: 3.2k input, 356.4k output, 7.7m cache read, 468.1k cache write ($29.14) 2⃣ gpt 5.6-sol (Codex) - extra-high Estimated total cost: $2,71 Token usage: total=117 989 input=79 695 (+ 4 072 576 cached) output=38 294 (reasoning 14 271) Total duration: 25m 23s Liczby raportowane przez narzędzia Codex i Claude Code. GPT‑5.6 Sol w Codex był zdecydowanie optymalniejszy ekonomicznie: - kosztował około 90,4–90,7% mniej, - był około 10,5 raza tańszy, - zużył około 9,3 raza mniej raportowanego outputu. Różnica kosztu wynosi około $26,4. Oznacza to, że Fable byłby ekonomicznie korzystniejszy dopiero wtedy, gdyby dzięki lepszemu rezultatowi oszczędził dodatkowo mniej więcej: - 32 minuty pracy człowieka wycenianej na $50/h, - 16 minut przy $100/h, Jeśli akceptujemy rozwiązania i przyjmujemy, że jakościowo są takie same to GPT-5.6 wygrywa ze znaczą przewagą.

Remek Kinas

11,238 просмотров • 1 день назад

KinasRemek's profile picture

W Polsce ekscytacja „Oze sr…e”, a w San Francisco i okolicach „Waymo sr…jmo”. Śmieję się bo mój wniosek po jeżdżeniu tym wynalazkiem jest taki, że wolę niekiedy oddać się robotowi, autonomii niż człowiekowi. Ale po kolei … Autonomia wtopiła się u ulice Doliny Krzemowej. Waymo ale też inne (na razie w fazie testów) to bardzo częsty widok. W zasadzie nic specjalnego …. Widzisz albo samochód widmo - ktoś siedzi zwykle z tyłu, albo kompletne widmo … wóz samotnie jadący gdzieś … gdzie? On tylko wie. Oglądam te stwory w różnych sytuacjach - pusta ulica, zmiana organizacji ruchu i kompletny chaos przed koncertem, ruch uliczny i centrum miasta. We wszystkich tych punktach czasoprzestrzeni radzą sobie wyśmienicie. Wzorce, które łatwo dostrzec: zdecydowanie (niektórzy mówią agresja) - starają się wcisnąć na pasy między przechodniami, chcą zmieniać pasy ruchu, wykorzystują różne takie luki, widzą przestrzennie ale też czytają (napisy na drodze - gdzie zostawić miejsce wolne), przepuszczają bardzo kulturalnie samochody włączające się do ruchu (no ja bym kiwnął ręką w podziękowaniu za takie ustąpienie), współpracują. Ten ostatni element jest ciekawy - tworzą autonomiczne swarmy. Wykorzystują mądrość grupową. Widziałem takie sytuacje gdzie Waymo między sobą współgrały i przepuszczały się na wzajem. To robiło ogromne wrażenie jak same się organizowały. Z punktu widzenia AI - fajna fuzja różnych modalności - LiDAR, wizja, radar, czujki dźwięku, świadomość grupowa pojazdów.

Remek Kinas

57,505 просмотров • 5 месяцев назад

KinasRemek's profile picture

Kolejny etap software engineering’u 🤩 Brak kodu!!! Zamiast dawać repo z kodem przekazywać repo z wymaganiami - product requirements documentation, architecture requirements, standards w etc. Wszystko zapisane w markdown. Zero kodu. Niech odbiorca sam sobie zakoduje :) Wczoraj wieczorem skończyłem właśnie pisać takie repo (Antec - personalny system agentowy - integruje najlepsze praktyki z 16 przebadanych systemów typu Clawd). W repo jest TYLKO komplet "ludzkich" dokumentów (jak kartki zapisane z koncepcją biznesową). Bez implementacji. Założenie jest takie, że klient pobiera repo, modyfikuje pliki wymagań markdown pod swoje potrzeby (dodanie, zmiana wymagań, wymagania technologiczne - typy baz danych, język programowania, jak ma być wdrażane np. docker czy w usłudze chmurowej). Uruchamiamy Claude Code (Codex) i system ten developuje całość do wdrożenia i utworzenia CD/CI. Puściłem dzisiaj rano implementację. Claude Code chodzi w 100% autonomicznie. Zarządza contextem przez podział wszystkiego na epic oraz user stories (tak opisałem wymagania). Fazy przekazywane są za pomocą tzw. handoverów (między fazami implementacji) - plików rozgrzebanej pracy (chociaż zakładam jak w scrum, że funkcjonalność jeśli podjęta musi być zaimplementowana, przetestowana - najwyżej może być różnica w zakresie implementacji np. 80%). Oprócz tego oczywiście wszystko opisane w Dodatkowo pliki (jako lessons learned) oraz plan (do planowania kolejnych sprintów). Stan na teraz: - liczba linii kodu - 16.006 l- iczba testcasów (trzy poziomy - komponent, integracja, e2e) - 283 - work in progress - zaimplementowano fazę 1 na 4 - planowane oddanie produktu jutro nad ranem (tak szacuję) Jak skończy implementację to zdam Wam raport ile było poprawek. Cel jest taki by doprowadzić do sytuacji gdzie kopiujecie repo, robicie zmiany, uruchamiacie klienta (Codex, Claude) po jakimś czasie otrzymujecie finalny produkt. Zobaczymy czy wyjdzie.

Remek Kinas

52,067 просмотров • 6 месяцев назад

KinasRemek's profile picture

🔥Sakana Fugu-ultra 🟩OpenAI GPT 5.5 🟩GLM 5.2 🟩Opus 4.8 TASK Create a high-quality single HTML file simulation of a Rube Goldberg / chain-reaction machine. The simulation should run automatically from start to finish without user input.The goal is to demonstrate whether the coding model understands real-world physics well enough to create believable cause-and-effect behavior - Rube Goldberg / chain-reaction machine. The scene should show a small physical world where objects interact through realistic mechanics: gravity, collisions, momentum transfer, ramps, pulleys, levers, springs, falling objects, rolling balls, dominoes, and water or particles if possible. The simulation should include: * A ball rolling down a ramp * Dominoes falling one after another * A lever or seesaw transferring force * A spring launcher * A pendulum or swinging weight * A pulley or elevator mechanism * Falling objects affected by gravity * Objects with different mass, friction, and bounce * Clear visual labels explaining what physical law is being demonstrated * A progress timeline showing the current stage of the chain reaction * Automatic reset/replay after the sequence ends The simulation should visually demonstrate: * Gravity * Momentum transfer * Conservation of energy * Friction * Torque * Elastic potential energy * Collision response * Cause and effect The model should not just animate objects on fixed paths. Objects should appear to interact physically. For example, the ball should knock over dominoes, dominoes should push a lever, the lever should launch another object, and so on. Evaluation criteria 1. Does the simulation run automatically without user input? 2. Do objects interact through believable physical cause and effect? 3. Are physical laws represented correctly? 4. Are labels and UI helpful? 5. Is the animation smooth and stable? 6. Does the code avoid fake-looking hardcoded movement? 7. Does the scene reset cleanly?

Remek Kinas

14,146 просмотров • 2 месяцев назад

KinasRemek's profile picture

Andrzej Dragan Andrzej Dragan wyjaśnienie publikacji :)

Remek Kinas

21,838 просмотров • 6 месяцев назад