Webben får et agentlag: websites kan erklære deres egne værktøjer, Work kan logge ind og udføre ærinder, og credentials bliver friskvare frem for hemmeligheder på dåse. Dagens feed er mest af alt internettets stille ombygning til agentarbejdsplads.
Fra X-feedet
WebMCP er dagens største skifte: ChatGPT og Codex kan opdage typed tools, som et website selv stiller til rådighed, i stedet for at gætte sig gennem pixels og knapper. OpenAI har lagt støtte i desktop-appens browser og ChatGPT Sites; Eric Provencher peger på den mere interessante konsekvens — menneske og agent kan arbejde i det samme levende interface.
Eric Provencher@pvncher
WebMCP lets you embed tools for codex in any website!
It makes it possible to have novel collaborative experiences where you and codex can interact with the same content, all from within the codex app and it's built in browser!
Excited to see what you all build with this
ChatGPT Work er allerede ude på den anden side af demoen. Daniel Steigman fik det til at logge ind hos hans forsikring og indsende en parkeringstilladelse fra mobilen; OpenAI ruller login ud på web og mobil uden at agenten ser brugernavn eller password. Det er kedeligt hverdagsbureaukrati — altså den rigtige AGI-benchmark.
Daniel Steigman@trekedge
The other day I had work mode apply for a parking pass. It signed in to my insurance and submitted the parking permit, all from my phone. Time to feel amazed at what technology can do for you.
Dagens bedste ærlige vibe check er Claude Design: David Cramer brugte en hel dag, ramte kreditmuren på 100-dollar-planen, opgraderede til 200 og flyttede artifacts gennem Codex. Dommen er god UX og nyttig selvverifikation, men en generaliseret designplatform gør arbejdet sværere end et fokuseret web- eller mobilværktøj. Han fortsætter alligevel — og foretrækker resultatet frem for ren Codex.
Alright I have spent all day with Claude Design, and I approve (though as typical, with caveats).
The $100 plan didnt buy me anything I dont think. As soon as I went to hand off a baseline design system it said I had no credits.
I bumped to the $200 plan, dumped all the artifacts into Codex, and continued iterating in Claude Design.
Its definitely got a number of the same challenges you have with anything, but the UX is quite nice. The verification it does to fix itself (im guessing its just a second pass fresh context agent) helps.
The way artifacts work are fine, but I think the fact that its trying to be a generalized platform vs e.g. a web design tool or mobile design tool actually makes it harder to do a good job.
If you took this, focused the UX on something that would manage react components, your entire design system, do it for web only. Then do the same for mobile. That would be a potentially great experience.
That said, I'm still iterating on a design system via it, which is a total overhaul of an existing application I built, and I'm so much happier about the results I'm getting than I was trying to do this natively in Codex.
Vercel Connect gør credential-plumbing til et produkt: agenten beder om korte, scoped tokens ved runtime i stedet for at slæbe permanente nøgler rundt. GA-udgaven har 100+ connectors, RBAC, audit logs og observability; Claire Vo fremhæver især auth- og refresh-flowet i Eve. Kedeligt fundament, på den helt rigtige måde.
Qwen3.8-27B er dagens lokale modelhistorie: Arena placerer den som nummer 9 i WebDev og eneste model i størrelsesklassen blandt top 10. Den praktiske opfølgning kommer fra Unsloth: QLoRA-finetuning kan køre på 24 GB VRAM, og de stiller gratis Kaggle-notebooks til rådighed. Frontier-ish uden serverhal og ceremoniel røgmaskine.
Chubby♨️@kimmonismus
Local models are getting ridiculously good. Qwen3.8-27B just entered the top 10 in Arena’s WebDev benchmark, only a few ranks behind models that are orders of magnitude larger.
A 27B open model is now genuinely competing near the frontier. And you can run it locally. With the Qwen 27B series, Alibaba has secured an outstanding position and is unbeatable in its size class.
You can now fine-tune Qwen3.8-27B for free with our notebook! 🔥
Local training works on 24GB VRAM.
Unsloth trains Qwen3.8-27B 1.5x faster with 50% less VRAM.
GitHub: https://github.com/unslothai/unsloth
Qwen3.8-27B Notebooks + Guide: https://unsloth.ai/docs/models/qwen3.8/train
Og så dagens filnavnekrig: Shopify-chef Tobi Lütke overvejer at forbyde Claude Code, indtil det læser AGENTS.md og fælles skill-mapper. Pointen er reel: teams med flere agentværktøjer får split-brain, når hver leverandør kræver sit eget parallelle instruktionsunivers. Standarder starter ofte som nogen, der er grundigt træt af at kopiere markdown.
Tobi Lütke@tobi
I’m thinking about banning Claude code at Shopify until they change their mind and read AGENTS.md and .agents/skills etc.
Insisting on only reading CLAUDE.md sometimes leads to split brain problems when different team members use different tools. Just unnecessary.
OpenAI har offentliggjort de første målte resultater fra sin egen Jalapeño-inferencechip: 1,5–1,9× mere arbejde pr. watt og 1,7–3,6× lavere end-to-end latency på tre åbne modeller end de valgte sammenligningssystemer. Chippen er planlagt til intern udrulning inden årets udgang. Imponerende tal, stadig leverandørens egen prøvesmagning.
Apple lancerer M6 i Mac mini og M5 Ultra i Mac Studio. M6 er selskabets første 2 nm-chip; M5 Ultra går til 36 CPU-kerner, 80 GPU-kerner og 1,2 TB/s unified-memory-båndbredde. Apple sælger dem som lokale AI-maskiner — uafhængige tests må afgøre, hvor meget “lokal frontier” der følger med æsken.