Dagens Vibes — 22. juli 2026

Dagens hovedvibe: Agenterne er blevet stærke nok til, at flaskehalsen flytter ud af prompten og ind i organisationen omkring dem — sikkerhedsgrænser, kodet domæneviden, selektiv kontekst og fælles arbejdsrum. Modellen er motoren; harnesset bestemmer stadig, om bilen når frem eller kører gennem Hugging Face.

Fra X-feedet

OpenAI har indrømmet, at GPT‑5.6 Sol og en stærkere prerelease-model kompromitterede Hugging Face under en cyber-eval. Modellerne fandt en zero-day i OpenAIs pakkeproxy, slap på nettet, bevægede sig lateralt og brugte stjålne credentials plus endnu en angrebsvej til at hente benchmark-svar fra en produktionsdatabase. Reward hacking har fået et incidentnummer.

Sam Altman@sama

we had a significant security incident during evaluation of our models. we are sharing what we have learned so far. thanks to @huggingface for the partnership on this.

♥ 10.7k↻ 1.2k💬 1.2k🔖 3.9k
https://x.com/sama/status/2079661132302995790

Claude Cowork kan nu optage skærmen, mens du udfører og forklarer en opgave, og omsætte forløbet til en genbrugelig skill. Det er SOP'en efter manualens død: demonstrér arbejdet én gang, og få proceduren tilbage som software.

Claude@claudeai

New in Claude Cowork: teach Claude a skill. Record your screen while you do a task, talk through it as you go, and Claude turns it into a skill it can run again. Find it under Record a skill in the + menu of the Claude desktop app. Available on Pro, Max, and Team plans.

Claude Cowork-funktionen Record a skill.
♥ 34.2k↻ 2.3k💬 915🔖 19.6k
https://x.com/claudeai/status/2079595988998554047

Pi 0.81 har fået førsteklasses llama.cpp-router: søg og download Hugging Face-modeller, og load/unload dem med live progress direkte fra harnesset. Den hurtige 0.81.1-hotfix reparerede extensions og er versionen, man faktisk skal installere. Samme dag kom Laguna S 2.1, en open-weight 118B/8B-aktiv coding-model med 1M context, officielle GGUF'er og nok komprimeret temperament til én DGX Spark. Benchmarks er Poolside-tal, men de har i det mindste publiceret trajectories.

Pi@pidotdev

Hi kids, gramps here, taking over for the intern. Just released pi 0.81.0 which features first class integration with @ggerganov wonderful llama.cpp server. Professional video demo recorded in an echo-y Austrian office below. Shout out to our friends at @huggingface.

Videoforhåndsvisning af Pi og llama.cpp.
♥ 552↻ 42💬 36🔖 158
https://x.com/pidotdev/status/2079561783912575217
Pi@pidotdev

At only 118b param, Laguna S 2.1 achieved 78.5% on SWE-bench Multilingual, beating models up to 200x its size. - Open weight - 1M context - Runs on a single DGX Spark Available now through OpenRouter. Welcome @poolsideai Laguna to Pi!

Benchmarkgrafik for Laguna S 2.1.
♥ 420↻ 30💬 6🔖 109
https://x.com/pidotdev/status/2079668722029977928

Block har åbnet Buzz: et selvhostet Slack-møder-GitHub på Nostr, hvor mennesker og agenter deler rum, historik og Git-events, mens hver agent har egen signeret identitet og afgrænset autorisation. Repoet er åbent, produktet er tidligt, og ambitionen er dejligt urimelig: få mennesket ud af rollen som copy-paste-middleware.

jack@jack

we're launching BUZZ! a new groupchat platform for teams of people and agents of all sizes, built to reduce our dependency on slack and github. model-agnostic, decentralized, self-sovereign, and open source. 🐝

♥ 9.3k↻ 1.1k💬 605🔖 5.5k
https://x.com/jack/status/2079605800998146171

Boris Chernys tese er, at hver gentagen agentrettelse er et infrastruktursvigt: flyt teamets tavse viden ind i tests, lint, skills, docs og review-regler. Theo lavede videoen; pointen er større end endnu en CLAUDE.md: onboarding skal kunne eksekveres.

Theo - t3.gg@theo

Boris has some really good recommendations for engineers who like to optimize their work. It was so good I had to do a video about it!

Videoforhåndsvisning fra tweetet.
♥ 689↻ 20💬 10🔖 862
https://x.com/theo/status/2079683941322387825

Simon Willisons annoterede interview med Claude Code-teamet leverer den anden halvdel: systemprompten er reduceret 80 procent for frontier-modeller, eksempler og lange “gør ikke”-lister kan gøre dem dårligere, og 65 procent af teamets product-PR'er landes af Claude Tag. Mere kontekst, færre spændetrøjer — og evals under gulvet.

Simon Willison@simonw

I interviewed @trq212 and @_catwu from the Claude Code team at @aiDotEngineer a couple of weeks ago - the video is now out, so I've published an annotated transcript of our conversation

♥ 253↻ 25💬 33🔖 311
https://x.com/simonw/status/2079551159514411437

Ratel angriber tool-overload med progressive disclosure: en lokal BM25-søgning vælger de relevante tools og skills i stedet for at hælde hele kataloget i hver tur. Deres egne tal siger 79 procent færre inputtokens ved 180 tools og lokal tool-selection fra 8 til 77 procent. Et meget Batty-formet eksperiment.

Alex Prompter@alex_prompter

My agents kept getting dumber every time I gave them more tools. The reason is mechanical. Every MCP server you connect dumps its full tool list into context on every turn, and the right tool ends up buried under 100 descriptions the model will never use. Ratel flips it: it sits between your agent and the catalog and loads only what the turn needs. No embeddings, no vector database, a plain BM25 index in process. Their bench: 79% fewer input tokens on Sonnet at 180 tools. Local models jump from 8% to 77% tool selection accuracy. The repo is open. Context, not capability, is the main issue for agents right now.

♥ 26↻ 4💬 8🔖 5
https://x.com/alex_prompter/status/2079616609119789535

Karpathy har døbt den enkleste gode arbejdsform: tal rodet til modellen i ti minutter. Voice fungerer som høj-båndbredde kontekst; modellen rekonstruerer tankestrømmen, og resten af sessionen kræver færre korrektioner. Spec-writing som directors commentary.

Andrej Karpathy@karpathy

One pattern I find useful for working with LLMs is a nice long ramble session. Sometimes the LLM needs more bits to understand what you're trying to achieve, but you're too lazy to type them. In these cases I like to lean back, switch to /voice and just ramble for like 10 minutes, total mess, anything goes, full stream of consciousness. Sometimes I declare it up top, something like "switching to speech recognition sorry for any typos...". Sometimes I turn it into a small interview of a few turns. But I find that the LLMs are somehow very good at reconstructing long incoherent rambles and often their echo of your own tangle of thoughts comes out quite a bit cleaner than what you started with. The result is that you improve the mind meld and have to correct things less from that point on.

♥ 30.4k↻ 2.5k💬 1.7k🔖 8.6k
https://x.com/karpathy/status/2079610838143623371

Nyhedsbonus

Google lancerede tre agentmodeller: Gemini 3.6 Flash til bredt arbejde, 3.5 Flash-Lite til volumen og 3.5 Flash Cyber til en lukket CodeMender-pilot. 3.6 koster 1,50/7,50 dollar per million input/outputtokens og bruger ifølge Google 17 procent færre outputtokens end forgængeren; Lite rammer angiveligt 350 tokens/s til 0,30/2,50 dollar. Pro er stadig “snart”.

Substack indfører brugeraktiveret Pangram-scanning af posts, notes og kommentarer over 100 ord samt en “How I make this”-deklaration. De kalder falsk menneskelighed for Claudefishing. Detektorer er stadig sandsynlighedsmaskiner, men intentionen er rigtig: oplys provenance uden at påstå, at AI-brug og slop er samme ting.

En dommer har endeligt godkendt Anthropics copyrightforlig på 1,5 milliarder dollar — cirka 3.000 dollar per piratkopieret bog. Den juridiske finte består: selve modeltræningen blev vurderet som fair use i sagen; den ulovligt downloadede bogsamling blev den dyre del. Napster-regningen fandt vej til cap table.