Gemini 3.7 Flash might be the first Flash model I’d actually want to test. • DeepSWE: 48.6% → 65.3% • FrontierCode: 34.4% → 43.6% • AutomationBench: 17.0% → 30.4% • OSWorld: 33.8% → 47.9% • Code Arena: 1538 → 1588 Elo Scores 56 on the Artificial Analysis Intelligence Index, one point above Sonnet 5, while costing $0.75/M input and $3.75/M output through ‘year end’??
Dagens Vibes — 14. august 2026
Dagens feed handler om tempo og organisering: billigere modeller, 750 tokens i sekundet og agenter, der får egne computere, chefer og videoredigeringsprogrammer. Coding ligner efterhånden mindre en chat og mere StarCraft med pull requests.
Fra X-feedet
Gemini 3.7 Flash er dagens store modelrelease: markante spring på coding og workflow-evals til $0,75/$3,75 per million tokens året ud. Tre uger efter 3.6. Googles versionsnumre har mistet retten til en kalender.
OpenAI og Cerebras angriber den anden flaskehals: Sol Ultrafast leverer op til 750 outputtokens i sekundet — 14× standardhastighed uden at skifte til en mindre model. For lange agentkæder er latency ikke pynt; den afgør, om workflowet føles levende eller som kommunal sagsbehandling.
RT @cerebras: Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at up to…
Previewing Ultrafast mode for @OpenAI's GPT 5.6 Sol, powered by Cerebras. GPT-5.6 Sol Ultrafast generates responses at up to 750 tokens per second. That's the full, GPT-5.6-Sol model -- up to 14× faster than the same model on Standard processing. It speedran Humanity’s Last Exam in 11h 11m, nearly 7× faster than Claude Fable 5 with comparable accuracy.
https://x.com/cerebras/status/2087948820906950719Lauren beskriver næste udviklingsmiljø: cloud-agenter med hver sin computer, screenshots, video og en separat sværm til at fuzz-teste arbejdet. Påstanden om worktrees’ død er bevidst teatralsk; isolation plus beviser er den interessante del.
Worktrees are dead 🎯
worktrees are dead. cloud agents are the future. they've allowed me to massively orchestrate swarms of agents, all with their own computer. it's how i've been able to trust that my agents are actually doing what i want them to, because they can run their code, take videos and screenshots, and interact with UIs the same way users do. cloud agents + pstack is the reason why i'm able to ship thousands of PRs a month with high confidence. spawn a verification /swarm of Grok 4.6 agents to "fuzz" every stack of PRs and you'll be able to let your agents merge their own work while you sleep! although i miss writing the code myself, the combination of using @bot, @cursor_ai, and the speed, intelligence, and efficiency of Grok 4.6 makes building so much fun. the future of coding is really starting to look more like playing starcraft!
https://x.com/poteto/status/2087977008253071816Hermes flytter samme idé ind i selve hierarkiet: hovedagenten kan læse live-transkripter, styre og stoppe subagenter, mens de arbejder asynkront. Det lyder basalt, fordi softwareorganisationer opfandt mellemledere for længe siden. Agenterne er bare først lige nået til 1987.
New in Hermes Agent: Your Hermes can now steer, end, and read live transcripts, of what your sub-agents are doing. Let your agent have full control over all of it's subagents while they work async! https://t.co/jMYRQzweM6
MiniMax Music 3 er den kreative afslutning: åbne vægte til komplette sange på op til fem minutter, fuld præcision under 24 GB VRAM og en langsommere vej helt ned til 8 GB. Musikmodellerne er kommet videre fra den evige 12-sekunders demo.
Thanks for Huggingface team @multimodalart , day 0 support open weight music model!
MiniMax Music 3 is just out on @huggingface 🎶🎵 SoTA song generation, now open weights 🔊, a 8B LLM + 2.7B DiT that turn prompt + lyrics into full songs fits smol consumer GPUs with 🧨 diffusers or comfy model weights + app on Spaces, come play ▶️ https://t.co/NOXKBkPPKZ https://t.co/yTeIsL89YP
https://x.com/multimodalart/status/2087933660490056163Nyhedsbonus
X har lagt sin centrale For You-ranker på GitHub under Apache 2.0 og tester en “Under the Hood”-eksport, hvor brugere kan se labels, der påvirker synligheden. Ikke hele maskinrummet er åbent, men ranker, filtre og en JSON-kvittering er mere konkret transparens end endnu et blogindlæg om transparens.
Microsoft gør det modsatte og rydder op: forbruger- og arbejds-Copilot smelter sammen, mens podcasts, Group Chats, Deep Research og Mico ryger ud. AI-produkter har officielt nået fasen, hvor nogen tør slette knapper. Sundt tegn.

