My notes on Kimi K3, plus some thoughts on what we can still learn from the pelican benchmark even while it becomes further detached from how good the models are at the things that matter (like agentic tool calling across longer conversations) https://t.co/F4AicvxAmq
Dagens Vibes — 17. juli 2026
Dagens hovedvibe: Kimi K3 presser frontierfeltet fra den åbne flanke, mens agenterne får de kedelige ting, der gør dem reelt brugbare: sikre logins, justerbar code review og vedligeholdelsesloops. Fremtiden ankommer åbenbart som både 2,8 billioner parametre og en ordentlig nøglebundt.
Fra X-feedet
Kimi K3 er dagens store modelhistorie: 2,8 billioner parametre, 1M context, native vision og næsten frontierniveau til Sonnet-pris. Vægtene kommer dog først senest 27. juli, og Simon Willisons pelikan brugte 13.241 reasoning-tokens — åben intelligens, lukket gashåndtag.
1Password for Claude giver browseragenten adgang til login og engangskoder uden at vise dem til modellen. Brugeren godkender med biometri, hemmeligheden injiceres direkte i siden, og resten af vaulten låses ned. Det er langt mere interessant end endnu en agentdemo, der kan bestille en pizza.
AI agents are booking travel, signing into websites, and acting on your behalf. That creates a new security problem: until now, letting an agent log in meant exposing your credentials to the model. Today, with @AnthropicAI, we're changing that. 1Password for @claudeai lets Claude use your stored credentials to complete real-world tasks without your passwords or one-time codes ever reaching the model, its memory, or Anthropic's systems. You stay in control and approve which credentials an agent can use. 1Password handles authentication behind the scenes. Available now on Mac for business, family, and individual customers. https://t.co/eg9Y1bW7uK

Claude Codes /code-review har fået effort levels: billigt og hurtigt til hverdagsreview, høj recall når noget virkelig skal flås fra hinanden. En lille kontrol, men præcis den slags model-routing der gør agentarbejde mindre binært.
Claude Code's /code-review now has effort levels, with the review rewritten at every one. Low effort beats other code review tools on findings at a fraction of the token cost. High effort delivers significantly higher recall when you want to go deeper. You pick the tradeoff. https://t.co/uT2K7jfXqQ

Ryan Lopopolo har gjort runner-image-vedligeholdelse til et fast agentloop: tjek aktuelle labels, kommende udfasninger, branch rules og grøn CI; åbn kun en PR når noget faktisk skal ændres. Fem minutters prompting køber den slags kedelig årvågenhed, som mennesker heroisk glemmer.
Agents are amazing because, while there is zero chance I would ever take the time to do this before, with 5 minutes of prompting, I have solved keeping GitHub Actions runner images both pinned and up to date, forever, with zero incremental effort on my part. Load it up for it for yourself 👇

Dagens lille frontend-gem: Cuelume syntetiserer klik, toggles og fejllyde live med Web Audio. 2 kB, ingen lydfiler, ingen dependencies — og mærkbart mindre “billig MP3-knap”.
Most UI sounds still feel cheap because they’re just MP3s. built synthesised tactile feedback that generates on the fly. crisp clicks, satisfying toggles, proper error tones. 2kb. zero files. zero dependencies. https://t.co/DN7wiYEpmi https://t.co/Az0HT4zPQs
Nyhedsbonus
EU-Kommissionen har vedtaget bindende DMA-krav, som skal give konkurrerende AI-assistenter samme adgang til centrale Android-funktioner som Gemini — inklusive stemmeaktivering og handlinger i apps. Fra juli 2027 kan standardassistenten på Android i EU endelig blive et reelt valg og ikke bare et ikonvalg.
Rivaliserende assistenter får dybere Android-adgang, og AI-søgetjenester bliver udtrykkeligt omfattet af Googles deling af anonymiserede søgedata.
Europa-Kommissionen · 16. juli 2026https://ec.europa.eu/commission/presscorner/detail/en/ip_26_1634I et nyt studie med 13.524 svar fra ti kommercielle modeller blev anmodninger om politiske protestflyers og satiriske digte afvist i 34 % af tilfældene for restriktive regimer mod 14 % for mere frie jurisdiktioner. Brugeren sad i Australien; censuren rejste selv. Årsagen er uklar, men effekten er ikke.
Oversight Board måler, hvordan lokale talerestriktioner ser ud til at sive ind i globale modellers svar og afvisninger.
Oversight Board · 16. juli 2026https://www.oversightboard.com/news/are-llms-stifling-political-speech-an-assessment-of-how-ai-models-protect-free-expression/