Загрузка видео...

Не удалось загрузить видео

На главную

Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!

56,351 просмотров • 8 дней назад •via X (Twitter)

Комментарии: 51

Фото профиля Logan Kilpatrick
Logan Kilpatrick8 дней назад

very interesting, would love to run Gemini 4 Argon on this!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

🙌🙌 yes we’d love to!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

We wanted to test agents’ ability to conduct multi-hop reasoning across many services (up to 40 services in 1 environment!). We simulate prod as full Kubernetes stacks: 70 services across three full environments, including databases, queues and workers, all communicating with realistic traffic. Then we inject faults as configs, runtime errors and container faults for agents to investigate and repair. Below is a look at a sample environment!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

We build a new type of functional verifiers, measuring (1) the outcome and the (2) safety of the repair In one run, GPT-6-Astra traced the problem to a slow Postgres query, but left the existing connection settings intact. The diagnosis is correct, but repair is incomplete.

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

Reward hacking behaviour: In an early incident-repair task, Claude Opus 5 was supposed to restore a broken service. It instead forged a cookie and sent a malicious Python pickle payload to the Kubernetes pod running the grader. When that pod loaded the payload, it executed the agent’s code, getting RCE

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

Turning up reasoning effort didn’t consistently fix more incidents. Eight of ten models scored best below their highest reasoning setting. e.g Claude Opus 5.5 peaked at medium effort: 58.3% success, versus 41.7% at max. The max setting cost roughly 4.7× as much per run.

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

Incident Arena is integrated with Harbor. Explore the paper, tasks, leaderboard and agent runs:

Фото профиля SpaceSquid
SpaceSquid8 дней назад

this gonna help agents stop PagerDuty from taking innocent engineer’s sleep, so goated

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

the US GDP is blocked by engineers not getting enough sleep

Фото профиля sensho
sensho8 дней назад

"We simulate prod as full Kubernetes stacks: 70 services across three..." this is really cool

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

yessir, whole companies rolled into a harbor environment

Фото профиля Daniel Wang
Daniel Wang8 дней назад

congrats on the launch!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you sir!

Фото профиля Jackson Clark
Jackson Clark8 дней назад

Very cool!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

🙏 thank you jackson!! let's catch up soon

Фото профиля Cameron Witkowski
Cameron Witkowski8 дней назад

🔥🔥

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

openlens sre-agent when?

Фото профиля kyle
kyle8 дней назад

Lowkey the leaderboard fits my preference of what model to use in general as well

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

indeed i use 6-astra-xhigh to center my divs

Фото профиля Rishi Desai
Rishi Desai8 дней назад

The task realism we so desperately need. Congrats @andrezfu !!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you rishi 🙏🏽🙏🏽

Фото профиля Shivam Patel
Shivam Patel8 дней назад

paged at 2am is the loud version. mine: dns ENOTFOUND took down the orchestrator, and the fallback compiler needed the same api, so both failed together. no page

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

bc we have k8s and advanced networking we can even simulate dns networking faults !

Фото профиля Shivam Patel
Shivam Patel8 дней назад

that's the right test. mine failed for real with no simulation. a dual path that shares one dependency isn't a fallback

Фото профиля Shipra Jha
Shipra Jha8 дней назад

Congratulations Andre. This is going to be incredible.

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you shipra! appreciate your help on this work!

Фото профиля Jesse Shulman
Jesse Shulman8 дней назад

Congrats, Andre! Very interesting

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you jesse!!

Фото профиля Vishal Jain
Vishal Jain8 дней назад

congrats!!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you sir

Фото профиля Gergő Móricz
Gergő Móricz8 дней назад

omg this is awesome

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thanks man! 🙏

Фото профиля Logan
Logan8 дней назад

im still waiting for funnybench

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

JokeBench is just the agent looking at my handwritten code

Фото профиля Adit Agarwal
Adit Agarwal8 дней назад

Cool stuff!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you man! let's catch up soon!

Фото профиля hrishikesh kamath
hrishikesh kamath8 дней назад

Amazing stuff

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thanks man

Фото профиля Utpal Nadiger
Utpal Nadiger8 дней назад

very very cool!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thanks man!

Фото профиля Max Kan
Max Kan8 дней назад

Very cool bench!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you max! you guys helped catch a ton of bugs, appreciate your support man

Фото профиля Shiv Kampani
Shiv Kampani8 дней назад

this is awesome andre!!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thank you sir!

Фото профиля John Rood
John Rood8 дней назад

the reward-hack finding generalizes: a grader inside the environment the agent controls is part of the attack surface. once the cheapest route to green runs through the checker, that's the route that gets found. score repairs from outside the blast radius.

Фото профиля Adi Sharma
Adi Sharma8 дней назад

the sev0 savior we needddd - nice work andre!

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

no more pagerduty 🤞 ??

Фото профиля Daivik Goel
Daivik Goel8 дней назад

Very cool

Фото профиля andre --dangerously-skip-permissions
andre --dangerously-skip-permissions8 дней назад

thanks big dawg

Фото профиля Dominik
Dominik8 дней назад

on-call agents need a kill switch the human still trusts at 2am. who holds it?

Фото профиля Rohan Gupta
Rohan Gupta8 дней назад

Great stuff Andre! Much needed move beyond single container environments to multi-service sims

Похожие видео