GLM-5.3 shows how much capability may still be hiding inside today’s largest base models and how relevant post-training really is. It uses the same base model (!) as GLM-5.2. Zai says the entire (!) improvement came from scaling post-training: more executable environments, longer tasks, stronger verifiers and more reinforcement learning. Remember: Pre-training gives a model knowledge and raw problem-solving capacity. Post-training teaches it how to use that capacity: plan, call tools, test solutions, recover from failure and complete work over long horizons. In cyber evaluations, GLM-5.3 moved from 24.4% to 54.4% on ExploitBench and completed 105 ExploitGym tasks in two hours, up from 29 for GLM-5.2. . Its weights are scheduled for release in two weeks. However, numerous other open weight models will be released in the coming weeks: -DeepSeek v4 Pro -Qwen3.8 27b -LTX 2.5 -Nemotron-Lighting -DeepSeek harness (just released, but harness isntead of a model) -Muse-Glimmer-30B (just released) to name a few. The US has meanwhile created classified cyber benchmarks and a voluntary pre-release process for "covered frontier models." What this release shows me, first and foremost, is that open models are continuing to move closer and closer to Frontier. And therefore, I believe that the US government will now further expand the regulatory framework to include open models. That's why I'm even more excited for the ChatGPT "Astra" release. Because this model is *also* receiving a new (and more extensive) pre-training component, and we're currently seeing how much additional capability is enabled through post-training. That's why this release is so significant; it demonstrates just how many areas for improvement are possible.
Dagens Vibes — 15. august 2026
Dagens feed peger samme vej fra to sider: post-training presser mere intelligens ud af gigantmodellerne, mens små åbne modeller og modulære harnesses gør agentarbejdet lokalt. Modellen er stadig vigtig; maskinrummet omkring den er blevet selve konkurrencen.
Fra X-feedet
GLM-5.3 er dagens tungeste signal: samme 743B-base som 5.2, men Z.ai siger, at bedre miljøer, verifiers og RL mere end fordobler resultatet på ExploitBench. Det er producentmålinger, men springet viser, hvor meget kapacitet der kan ligge gemt efter pre-training.
I den mindre ende lander Qwen3.8-27B med billeder, video, 262K kontekst og Apache 2.0. Qwens egne benchmarks skal gennem den sædvanlige vaskemaskine, men 27B er en størrelse, man faktisk kan forestille sig at eje.
Qwen-3.8 27b released! Significant jump! Qwen just released Qwen3.8-27B, a compact open-weight multimodal model that reportedly competes with much larger frontier systems. Despite having only 27B parameters, it claims state-of-the-art results in agentic coding, computer use, browser tasks, and long-horizon professional work, beating Claude Opus 4.6 Max on several benchmarks. It supports images, video, configurable reasoning, a native 262K context window expandable to 1M, and can be self-hosted under Apache 2.0. tl;dr: frontier-level agent capabilities are becoming smaller, cheaper, and openly deployable. The benchmark results are Qwen’s own and still need independent verification.
DeepSeek angriber laget rundt om modellen: Harness gør modeller, tools, skills, sessions, sandboxes, loops og UI til plugins. Ollama har koblet det direkte på lokal kørsel. Alt er et plugin; også de næste tre aftener.
Ollama now supports the DeepSeek Harness. ollama launch dsh Run it completely in your own environment. It comes with Ollama's web search pre-installed. You can use its trajectory view to see what is happening in the background.
🧩 DeepSeek Harness v0.1 is now available in Developer Preview! 🔹 We’re opening it up to developers building agent harnesses worldwide and open-sourcing the codebase in MIT license. 🔹 Powered by the Cordis meta-framework, DeepSeek Harness is an agent harness built around one core idea: Everything is a plugin. Models, tools, skills, sessions, sandboxes, filesystems, loops, orchestration, and UI are ALL implemented as plugins, and can be mixed, matched, replaced, and extended. Try it now! https://github.com/deepseek-ai/deepseek-harness
https://x.com/deepseek_ai/status/2087887408440164663Turbopuffer leverer dagens dybdelæsning: en control plane til 100+ clusters, hvor lokale Kubernetes-agenter kan fortsætte autonomt, mens den centrale API og metadata bor i PlanetScale. p99.9 kræver mest af alt, at centrum ikke bliver en dramatisk hovedperson.
great post from the p99.9 engineering team over at @turbopuffer https://turbopuffer.com/blog/control-plane
Mitchell Hashimoto har benchmarkbygget libghostty som WebAssembly mod xterm.js: hurtigere IO, reflow og render-forberedelse, selv med grapheme-processing. Tallene er hans egne, men harnesset er konkret og prebuilt WASM ligger i releases.
libghostty for WebAssembly got a lot of love recently and is now very, very, very good. I spent the day building harnesses and comparing to xterm.js and here are the results: faster at IO, faster at reflow, faster at rendering. Like, a lot a lot faster. We now provide pre-built `ghostty-vt.wasm` files in our GitHub releases. These are the fastest, most optimized builds that are compatible with every major browser going back a number of years. Before going over setups, I want to say that xterm.js is very good software. It is a relatively modern terminal, the maintainers are very nice, it's done incredible work for the web terminal ecosystem. I have nothing against them, but I'm in the business of making super fucking fast terminal emulators. Let me explain the setup in every case: IO throughput: This is an apples-to-apples comparison of `ghostty_terminal_vt_write` vs xterm's `Terminal.write(Uint8Array)` timed from first write to final completion callback. This is testing how fast a terminal emulator can process input and update internal state. Nothing else. Units are in MB/s processed. Note for graphemes: Ghostty has grapheme processing enabled and xterm.js does not (requires an addon). So, this shows how Ghostty does better despite having that cost. Column reflow throughput: Compares `ghostty_terminal_resize` to xterm's `Terminal.resize` with identical terminal states (same content, same size, same scrollback). The "dance" is rapid bigger/smaller resize of matching column widths, forcing text reflow. Units are in resizes/second. Render speeds: These test use the identical xterm.js WebGL renderer for both Ghostty and xterm.js. Since the renderer is identical, we can focus on how long it takes to prepare the inputs to the renderer (build the render state) and assert we get the same output byte-for-byte (since its the same renderer!). This is the truest way to measure these two because libghostty-vt itself does not provide a renderer, its about how long it takes to go from terminal state to render-ready. Full render: This tests a fresh renderer with nothing previously rendered. Units are in updates/second. Incremental render: This tests having prior state and only rendering specific changes such as adding scrollback, moving the viewport, moving the cursor. Units are in updates/second. This is using the latest released version of xterm in every case compared to the HEAD libghostty (since we haven't tagged a release, exact commit d760ee96e54657416eb427b793c7e839f003df7d).
På den hjemlige front vil Mogens Nørgaard droppe mere menneskelig indblanding i offentlig sagsbehandling, før agenternes sagsproduktion drukner systemet. Det er et debatindlæg, ikke en færdig forvaltningsmodel — men meget direkte F2X-foder.
I er velkomne til at tæske løs på mig for dette standpunkt. Men jeg tror ikke der er andre løsninger, hvis vores offentlige sektor skal have en chance for at kunne fungere i de kommende år. Med mindre vi ansætter samtlige danskere i det offentlige. https://www.computerworld.dk/art/296509/noergaard-ingen-vej-udenom-vi-maa-snart-droppe-menneskelig-indblanding-i-den-offentlige-sagsbehandling
Nyhedsbonus
Reuters skriver, at Apple træner en Kina-specifik model med Alibaba. Det kan blive en sjælden vej gennem både kinesisk modelgodkendelse og Apples haltende lokale AI-strategi — geopolitik forklædt som produktintegration.
Google gør det synlige AI-vandmærke valgfrit i Gemini og Flow, mens SynthID og C2PA bliver siddende. Proveniens forsvinder altså ikke; den bliver bare usynlig for alle, der ikke aktivt leder efter den. Praktisk design, mudret tillid.


