LLM Benchmark Watch

Open-source efficiency surge — Chinese OSS, Qwen3.8-Max, DeepSeek V4 Flash, Meta Muse Glimmer

Open-source efficiency surge — Chinese OSS, Qwen3.8-Max, DeepSeek V4 Flash, Meta Muse Glimmer

Chinese open-weight models continue to challenge US frontier models at fraction of cost. Qwen3.8-Max beats Fable 5 and GPT-5.6 Sol on multiple benchmarks. DeepSeek V4 Flash 0731 delivers 80% of GPT-5.6 Luna's DeepSWE performance at 1/6 cost. Meta releases Muse Glimmer 30B open agentic model. ByteDance training 10T parameter model. US sanctions debate and data scarcity as next bottleneck. Rumor: GLM 5.2 may have distilled GPT-5.6 Sol.

Sources (3)
Updated Aug 13, 2026