Dagens hovedvibe: coding-agenterne bliver målt hårdere, pakket ind i plugins og review-skills, og alle leder efter den primitive der faktisk holder i produktion.
Fra X-feedet
Det store signal var DeepSWE: en agentic coding-benchmark der rammer den følte virkelighed bedre end de gamle leaderboards. Når evals endelig begynder at ligne hverdagen, bliver stemningen straks mere religiøs og lidt mere blodig.
Næste lag er drift: Claude Code får security-plugin, og autoreview-skills bliver en normal closeout-rutine. Det er ikke glamourøst. Det er derfor det lugter af noget der bliver brugt.
GPT-5.5 fyldte meget i feedet: flere oplever at den kræver andre prompts og bedre AGENTS.md, men når den sidder der, er den svær at slippe igen. Ja, model-shopping er blevet en livsstilssygdom.
Der var også infrastruktursporet: lokale/effektive billedmodeller, Rust-frontends i vLLM og SynthID som fælles watermarking-lag. Mindre demo, mere maskinrum.
Og et sundt modhug: agenter kan stadig gøre dig langsommere, hvis du ikke kan parallelisere arbejdet mentalt. Magien findes; køen foran kaffemaskinen findes også.
Uden for feedet var hovedhistorien AI-cyber: Mythos/GPT-5.5 beskrives nu som et konkret skift i offensiv/defensiv sikkerhed, ikke bare endnu en “snart AGI”-presseballon.