Dagens Vibes — 22. august 2026

Modellen er kun motoren. Ox Alpha ligner en model fra GLM-5.X-familien og får sin første ordentlige prøvetur; NVIDIAs harness klarer alle 183 offentlige ARC-AGI-3-niveauer; og Pi spørger høfligt, om MCP overhovedet behøvede komme med.

Fra X-feedet

Ox Alpha overtog feedet: et gratis stealth-drop med 1M context og multimodale input. Plinys agent peger på Z.ai og GLM-5.X-familien. Det er ikke officielt bekræftet, men et væsentligt spor. Robin Ebers’ 20 videoredigeringer giver det praktiske vibe check.

OX
Ox Alpha på OpenRouterStealth-model · 1M context · tekst, billede og videohttps://openrouter.ai/stealth/ox-alpha

DeepSeek svarede med en officiel multimodal Flash-model til API’et. Den matcher ifølge DeepSeek tekstmodellen og nærmer sig Opus 4.8 på visuelle agentbenchmarks; billeder koster højst 384 tokens ved almindelig V4-Flash-pris. Ingen solid uafhængig vibe check i feedet endnu, så stjernerne bliver siddende på producentens uniform.

NVIDIAs AVO løste alle 183 niveauer i ARC-AGI-3’s offentlige sæt med Opus 5, hvor standard-harnesset lå omkring 30 procent. Det er ikke et privat leaderboard-resultat eller en ren 30→100-ablation, men persistent hukommelse, feedback og en supervisor flyttede systemet voldsomt. Samme loop har tidligere kørt syv døgn på GPU-kerneloptimering. Harness engineering er blevet modelarbejde uden vægtløftning.

AVO
NVIDIA AVO når 100% på ARC-AGI-3’s public setPersistent memory, execution feedback og supervisor · 183/183 niveauerhttps://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Et studie kørte en softwareopgave gennem syv agenter og fem modeller: i et domæne med moden CLI løste agenter uden indbygget MCP opgaven lige så stabilt og 5–28 gange billigere. Det er ét afgrænset setup, ikke MCP’s dødsattest — men “brug de eksisterende kommandolinjeværktøjer” er et mistænkeligt effektivt plot twist.

CLI
MCP eller CLI? Et studie på tværs af syv agenterarXiv · samme pålidelighed, markant lavere tokenpris i det testede CLI-domænehttps://arxiv.org/pdf/2608.08654

To små arbejdsformer med høj brugsfaktor: Matt Pococks /implement-spec splitter en spec ud i parallelle worktrees og reviewer samlet mod originalen; Arnav Gupta peger på medium effort og Pi’s lille systemprompt som sweet spot. Maksimal tænkning er ikke altid maksimal intelligens. Nogle gange er det bare dyrere maskinbekymring.

/SPEC
Matt Pococks implement-spec skillResearch → parallel implementering → review mod spec → oprydninghttps://github.com/mattpocock/skills/blob/main/skills/in-progress/implement-spec/SKILL.md

Nyhedsbonus

Anthropic åbner Mythos 5’s offensive styrke gennem en smal defensiv luge: Claude Security kan scanne ejede repositories og returnerer sårbarheder, CWE, severity og foreslåede patches — men brugeren får artefaktet, ikke fri adgang til modellen. Samtidig lægger de 35 millioner dollar i credits til open source-sikkerhed. Capability containment som produktdesign, ikke bare en større advarselsboks.

0xDAF
Claude Mythos 5 kommer til flere cyberforsvarereAnthropic · 21. august · Claude Security og $35 mio. til open source-sikkerhedhttps://claude.com/blog/bringing-claude-mythos-5-to-more-defenders

DeepMind gør EVE Online til næste agentlaboratorium: en verden med 23 års økonomi, alliancer og konflikter skal teste hukommelse på tværs af context windows, planlægning over måneder og multi-agent-forhandling. Første stop er en offline sandbox — robotterne får ikke adgang til rumkapitalismen uden prøveperiode. Fornuftigt.

EVE
Fra Atari til EVE Online: 15 års AI-forskning i spilGoogle DeepMind · 21. august · continual learning, langtidshukommelse og multi-agent-dynamikhttps://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/