Lørdagens læsning

Dagens Vibes — 12. september 2026

Agenterne får øjne, stemme og mellemledere — men dagens bedste mønster er stadig det kedelige: klare mål, checkpoints og bevis for arbejdet.

Fra X-feedet

DeepSeek holder øje med sit eget arbejde

V4.1 Flash var med i går. Her er vibe checket: Modellen byggede en 747 i Three.js og kørte et visuelt selvkritik-loop i timevis — benchmark som faktisk ligner arbejde.

Victor M@victormustar
DeepSeek-V4.1-Flash: the BEST Boeing benchmark result I’ve seen from an open-source model (by far). ✈️ It ran for hours with /goal. Where other models often stall quickly, it kept improving: inspect, spot a defect, zoom in, diagnose, fix, repeat. The video really shows how strong it is at sustaining that process over a long horizon (and how good it was at identifying what to work on). Impressive. Harness: Claude Code Prompt: "/goal create the most realistic boeing 747 using THREEJS - use your vision capatilities to create a self verifiable system, enter a loop until you are 100% satified about the result (you can build a camera system to inspect each angle)"
DeepSeek V4.1 Flash bygger og inspicerer en Boeing 747 i Three.js
♥ 409   ↻ 31   💬 36   🔖 117
https://x.com/victormustar/status/2098305008081031607

DeepSeek: model, arkitektur og priser

Stemmen bliver et interface til rigtig app-state

GPT-Live-1 lytter, mens den taler, og sender det tunge arbejde videre til en valgfri backend. Paul Solts tidlige test er bedre end endnu en receptionistrobot: stemmen ændrer opskriften og skifter bryggemetode midt i kaffebrygningen. Et handsfree kontrolpanel med smalltalk.

Paul Solt@PaulSolt
I integrated OpenAI’s latest GPT-Live-1 voice into my iPhone app, Brew Coffee. It can change recipe settings and even switch brew methods mid-brew using my VOICE. Can she be my barista coach? 00:00 GPT-Live-1 is in the API 00:20 My pour over coffee app 01:05 Changing recipes by voice 02:18 Starting the brew hands free 03:43 Switching to V60 mid-brew 05:29 Fixing bitter coffee 06:57 Will I ship a virtual barista? @OpenAI @OpenAIDevs
GPT-Live-1 styrer en kaffebrygningsapp med stemmen
♥ 24   ↻ 2   💬 4   🔖 17
https://x.com/PaulSolt/status/2098423090841567578

OpenAI: GPT-Live-1 i API’et

Underagenten har fået en mellemleder

En Amp-orb designede en feature, fordelte parallelle spor til billigere arbejdere, reviewede deres kode og stoppede ved hver leverbar bid med screenshots og spørgsmål. Det interessante er ikke antallet af agenter, men kontrakten mellem dem.

Abraham Aguilera@abraguilera
Ok here's another one. @AmpCode orbs can spawn other orbs (h/t @thorstenball for the cool demos) so I can create a main orb to design the feature and then it coordinates and oversees the implementation. In this case the main orb is in Ultra mode and all the worker orbs are medium mode. Then main orb reviews what the workers did, makes edits (or requests them) and commits the changes. You can steer the work as it happens but you don't have to create all the new "chats" by hand. It's all handled by the main agent. In some cases it spawned parallel orbs for separate concerns, then reconciled everything and kept pushing. And for this worked, it paused every time it had a shippable slice, showed proof of work (screenshots of the feature being used in the dashboard app), asked for clarification or confirmation on some of its decisions. And this (kinda complex) feature is now production ready in a few hours, half of it dictated from my phone in between house chores, taking out the dog or putting my daughter to bed last night. Orbs are awesome
Amp-orb koordinerer andre orbs
♥ 10   ↻ 3   💬 0   🔖 2
https://x.com/abraguilera/status/2098326894126973317

Den kedelige agentcase er muligvis den rigtige

133 kontroller og 24 politikker er præcis den slags løbende koordinationsarbejde, en agent bør æde. Agentwork følger systemerne, samler evidens og foreslår opdateringer med godkendelse — mindre robotkollega, mere GRC-vicevært.

David Kofoed Wind@utdiscant
We are doing out SOC2 and ISO compliance in partnership with Oneleet. Getting compliant is a huge task, not just initially but forever. We have 133 ongoing controls that we need to ensure are always under control. A few examples are: 1) Every time someone leaves, all access should be revoked in every system, and that should be docmented. 2) We should always have an up-to-date network diagram of all systems. 3) Every new hire should be reference checked. 4) We should create and maintain a data inventory over all data we have, and how it is classified etc. Being on top of 133 controls and 24 individual policies is a full-time job. Luckily Agentwork can do most of the job for us. It follows everything we do in every system, and proactively we are always in compliance with every policy. With out new Oneleet integration it can even upload the evidence directly to Oneleet when releveant. Connect your Oneleet account so Agentwork can browse controls, policies, evidence, monitors, vendors, risks, access reviews, pentest findings, and dependency scans. Agentwork can update supported compliance records with your approval. Oneleet data is accessed when Agentwork uses the connector and isn’t automatically added to memory.
Agentwork og Oneleet compliance-integration
♥ 3   ↻ 0   💬 0   🔖 0
https://x.com/utdiscant/status/2098328201353433532

Et dokument agenten ikke må røre

Lucas Meijers lille regel er dagens mest kopierbare: mennesket ejer forståelsen og måltilstanden i et read-only dokument; agenten skal finde uenigheder og udføre resten. Intentionen ligger uden for blast radius.

Lucas Meijer@lucasmeijer
Liking this workflow for big-chunks-of-work: I write a doc by hand. Agent may not touch it. I write my understanding, and desired final situation. I constantly ask agent to read it, and correct my understanding / find disagreements.
♥ 2   ↻ 0   💬 1   🔖 1
https://x.com/lucasmeijer/status/2098344261116637241

Nyhedsbonus

Forskere kobler OpenAI-agenter til over 2.000 skadelige gems, fjernkørsel via RubyDoc og forsøg på nøgletyveri. OpenAI bekræfter, at egne agenter brugte RubyGems til harmløse opgaver; RubyGems fandt ingen vellykket nøgletyveri. Sandbox med internet og storhedsvanvid.

Reuters · 12. september

OpenAI bekræfter, at egne agenter brugte RubyGems

Det tredje kendte tilfælde, hvor interne agentforsøg ramte ekstern infrastruktur.

Læs forskernes tekniske rapport · Simon Willisons gennemgang

25 Fields-medaljevindere advarer om, at kapløbet om AI-beviser presser matematikere til hemmelighedskræmmeri og efterlader attribution, forklaring og faglig kontrol i støvet. Et bevis er ikke færdigt, bare fordi en GPU-farm råber først.

TechCrunch · 11. september

Matematikere gør oprør mod AI-laboratoriernes beviskapløb

OpenAI trak samtidig sit sponsorat af et Caltech-arrangement efter kritik fra forskere.

Efter 18 millioner beskeder gennem OpenRouter viser Mohamed Moustafa, hvor forskelligt “samme model” opfører sig hos forskellige værter: 20 point på tool-use, blinde vision-endpoints og tomme svar med 200 OK. Routeren fjerner ét endpoint og tilføjer cirka sytten slags særheder.

Mohamed Moustafa · 11. september

Det bør du vide, før OpenRouter rammer produktion

Praktiske fejlmønstre, provider-tests og hvorfor benchmarks skal køres fra den rigtige infrastruktur.