Dagens Vibes — 19. august 2026

Dagens feed handler mindre om endnu en model og mere om maskinrummet omkring den: strukturerede data, evals, færre round-trips og menneskelig dømmekraft. Agenterne er blevet nyttige nok til, at infrastrukturen pludselig betyder mere end demoen.

Fra X-feedet

Den stærkeste produktionshistorie: syv agenter behandler rigtige healthcare-claims under HIPAA. Første måned rørte holdet ikke en model; de byggede 34 versionerede variable pr. claim, fjernede patientdata, validerede mod stramme schemas og lod systemet fejle lukket. Modelintegrationen var den korteste linje i fire måneders arbejde. Sådan ser forskellen på en agent og en demo ud.

Hugging Face lod 1.221 mennesker og deres coding agents forsøge at reproducere 2.226 ICML-papers. 6.816 offentlige logbøger senere havde 23 procent mindst én falsificeret eller omstridt påstand — og de bedste resultater kom stadig fra mennesker, der styrede forsøget og stillede det irriterende spørgsmål én gang til.

ICML
What We Learned by Reproducing 2,200 papers from ICMLHugging Face · offentlig kode, logbøger, spor og claim-for-claim-verdictshttps://huggingface.co/blog/icml-2026-open-reproductions

Addy Osmani rammer den nye engineering-rolle præcist: mennesker ejer produktintention, systemdesign og kvalitetsbar; tests, typer, mutation testing og arkitekturregler gør smagen maskinlæsbar. Flere checks er ikke kvalitet. Signal er kvalitet. Fabrikken skal stadig have en ansvarlig voksen.

Dagens stille performance-gem havde tre likes og et bedre datapunkt end de fleste konferencetalks: at skære 12.000 tokens gjorde en agent billigere, men ikke hurtigere. At gå fra fire modelkald til ét sænkede svartiden fra 31,7 til 9,05 sekunder. Tæl round-trips før du påkalder prompt-voodoo.

Vercel lægger op til én million dollar på bordet for folk, der kan slippe ud af deres Firecracker-sandbox eller bryde netværksgrænsen. Når agenter selv kan kortlægge gæstekernen, bygge en reproduktions-VM og skrive fuzzeren, er isolation ikke længere kedelig drift. Det er produktet.

$1M
$1 million hacker challenge for Vercel SandboxVercel · 18. august · op til $50.000 pr. valideret rapporthttps://vercel.com/blog/one-million-dollar-hacker-challenge-for-vercel-sandbox

Den lille arbejdsform til sidst: en Claude-agent samler supporttickets, sorterer spam, triagerer features og vedligeholder en support.md plus kundernes knowledge hub. Jack skriver stadig svaret selv — bare ti gange hurtigere. Autonomi er overvurderet; overblik med turbo er bedre.

Nyhedsbonus

Anthropic har fået wet-lab-resultater tilbage: Claude designede bindere mod 14 af 15 proteinmål, med hit rates på 22,6–35,1 procent mod typisk 10–15 procent. Eksterne laboratorier producerede og testede dem; samme udgivelse viser Opus 5 afkode rå NMR- og LC-MS-filer på under 25 minutter. Det er en sjældent håndgribelig AI-nyhed — molekylerne kan ikke presses til at like pressemeddelelsen.

LAB
How Claude is accelerating protein design and analytical chemistryAnthropic · 19. august · eksternt validerede wet-lab-resultaterhttps://www.anthropic.com/research/Claude-accelerates-protein-design

OpenAI lancerer ChatGPT for Teens med automatisk teen-oplevelse ved estimeret alder under 18, Study Mode, homework-reminders, Study Hours og forældrekontroller. Den vigtige ændring er ikke endnu en policy-side, men at sikkerheds- og læringsvalgene bliver produkt-defaults.

13–17
Introducing ChatGPT for TeensOpenAI · 18. august · læring, aldersestimering og skærpede standardværnhttps://openai.com/index/chatgpt-for-teens/