Fredagens læsning

Dagens Vibes — 11. september 2026

Kodeagenten er ved at forlade chatvinduet: koordinatorer, vedvarende projekter og managed harnesses gør softwarefabrikken til et produkt.

Fra X-feedet

Cursor gør projektet til agentens arbejdsplads

Projects samler måneders arbejde i én vedvarende koordinator, som deler hukommelse og artefakter med lokale og cloudbaserede subagents. Den kan følge Slack og pull requests eller arbejde efter en tidsplan — Batty med PR-statistik og et salgsteam.

Cursor@cursor_ai
Introducing Projects, a new way of working in Cursor. Rather than creating a chat for every task, you work with a coordinator agent in a single, persistent thread. Like @bot, your agent is always on, proactively manages work with subagents, and improves over time. https://t.co/9RREyjtnTz
Cursor Projects
♥ 6.172   ↻ 348   💬 289   🔖 2.573
https://x.com/cursor_ai/status/2098162488013455784

Cursor: sådan virker Projects

OpenAI sælger Codex-harnessen som API

Agents API gør orkestrering, lange sessioner, compaction, tool search og subagents til en managed platform. Man kan vælge OpenAI-sandbox, egen infrastruktur eller en partner — og dermed købe sig fri af en stor del af agent-VVS’en uden at opgive hele maskinrummet.

OpenAI Developers@OpenAIDevs
Go from idea to a working agent faster with the Agents API. Build and run cloud agents with the Codex harness, fully managed by OpenAI. We handle orchestration, long-running sessions, and context management. You focus on what makes your agent unique. Available in public beta. https://t.co/74siIaFdg4
OpenAI Agents API
♥ 1.928   ↻ 171   💬 89   🔖 1.566
https://x.com/OpenAIDevs/status/2098130570048045453

OpenAI: Agents API i public beta

DeepSeek V4.1 Flash angriber agentregningen

Den nye open-weight 552B MoE-model aktiverer kun 8B parametre på input og 16B på output; KV-cachen bruger en fjerdedel af HBM og en ottendedel af SSD-pladsen fra forgængeren. Native vision og én million tokens er flot på papiret — dagens tidlige vibe check er, at den faktisk fungerer som billig browser- og knowledge-work-driver.

DeepSeek@deepseek_ai
🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6
DeepSeek V4.1 Flash
♥ 25.481   ↻ 2.816   💬 835   🔖 4.221
https://x.com/deepseek_ai/status/2097930608790167907
gabriel@gabriel1
been running with deepseek as daily driver today for all my knowledge work it's extremely strong for it's price on navigating the browser, try it on Energy
♥ 164   ↻ 4   💬 9   🔖 20
https://x.com/gabriel1/status/2098173725858566565

DeepSeek: arkitektur, priser og API · Weights på Hugging Face

Shopify går tilbage til native — på grund af AI

Da agenter kan oversætte funktioner mellem Swift og Kotlin, er delt React Native-kode ikke længere den afgørende besparelse. Shop-appen blev genbygget på 12 uger, men den bedste detalje er Helix: små checkpoints, tests, visuel kontrol, to adversarial reviews og menneskelig godkendelse. AI gør omskrivningen billig; verifieringen gør den mulig.

Tim Sneath@timsneath
Native is now the future of mobile at ⁦@Shopify⁩. Why the world has changed with AI such that the trade-offs have tilted. https://t.co/8emsITKInX
♥ 120   ↻ 19   💬 6   🔖 27
https://x.com/timsneath/status/2098063556839379165

Shopify Engineering: Native is now the future of mobile

Samme model, tre gange flere løste opgaver

For 50 dollars lod Joël Niklaus en meta-agent forbedre OpenCode-harnessen omkring GPT-OSS-20B. Tre banale regler bar gevinsten: test før stop, udfør det du netop sagde du ville gøre, og reparér entydigt malformed tool calls. Harnessen er også modellen; benchmarktabellerne sukker tungt.

Joël Niklaus@joelniklaus
Same weights. $50 of harness search. 3x on Terminal-Bench. We optimized the OpenCode harness for GPT-OSS-20B (high reasoning) with a meta-harness: an agent that reads failures, patches the harness, and validates the improvement. The model never changed. On held-out Terminal-Bench 2.1, the optimized harness scored 14.8%, up from OpenCode's 4.8%. That is 3.08x, from $49.97 of API credits. Three harness fixes carried most of the gain: - i7, verify before stopping: the model often edited code and ended the session without testing it. The harness gives it another turn to run the code. - i14, continue announced actions: the model would say "now run X" and then stop. The harness keeps the session going so it runs X. - i23, repair malformed tool calls: one extra `]` made OpenCode reject otherwise valid commands. The harness repairs that clear-cut error. How the meta-harness ran: 1. Start: stock OpenCode v1.18.13 + GPT-OSS-20B scored 8.5% on the dev split. 2. Iterate: Claude Code (Opus 5 max) reads the failed dev trajectories and proposes one patch. We build it and run it once per dev task, paired against the current parent. 3. Validate: candidates that clear a pre-registered margin get a 5-trial validation. They become the new parent only if their validated score surpasses the current one. 4. Stop: the loop ended after 23 iterations and about 2.4k dev attempts, when the $50 search budget was spent. Takeaway: pre-training puts capability in the weights, and post-training makes that capability usable. Harness optimization continues the same work at inference time, turning the model's behavior into more completed tasks. Same weights, 3x the finished tasks.
Tre gange højere Terminal-Bench-score efter harness-optimering
♥ 41   ↻ 8   💬 13   🔖 31
https://x.com/joelniklaus/status/2098064253404225640

Nyhedsbonus

AI sænker friktionen i mødet med det offentlige — og sagsmængden eksploderer. TechCrunch finder blandt andet femdoblede forbrugerklager i USA; meget er ikke spam, men legitime krav som før blev opgivet. Digital selvbetjening skal snart kunne tåle, at borgeren også møder op med en agent.

TechCrunch · 10. september

AI-agenter oversvømmer offentlige tjenester med henvendelser

84 cases i 11 jurisdiktioner peger på et nyt kapacitetsproblem — og en reel adgangsgevinst.

Universal og ElevenLabs bygger en særskilt, licenseret platform til remixes, mashups og nye fortolkninger fra kunstnere, der vælger at deltage. Pladeselskabet forsøger med andre ord at gøre den uundgåelige musikslop fakturerbar og nogenlunde samtykkebaseret.

The Verge · 10. september

UMG og ElevenLabs laver licenseret AI-musikplatform

Fans får lov at bygge videre på kataloget; kunstnere og sangskrivere skal have del i værdien.