Тиждень міні-апдейтів: Grok 4.6, Gemini 3.7 Flash, DeepSeek V4-Pro 0813, GLM-5.3, Qwen 3.8 27B, MAI-Code 1.1 Flash і Muse Glimmer — всі підтягнули генерацію коду без зміни архітектури.
Grok 4.6
https://x.ai/news/grok-4-6
xAI випустила 12 серпня чисто post-training оновлення на тому ж ≈1.5T базі, що й Grok 4.5. З точки зору генерації коду це 1 публічний результат на FrontierCode v1.1 Extended (61.3%), APEX-SWE 56.4%, CursorBench v3.2 підріс з 66.7% до 69.9%. Головне покращення — модель більше самостійно тестує й перевіряє свій код у довгих агентних сесіях, тож витрачає значно менше марних кроків (≈53 ходи проти ≈103 у Claude Opus 5).
Слабке місце як і раніше — робота в терміналі (Terminal-Bench 3.0 лише 26%). Елон пише що Grok 4.7 вже за декілька тижнів. Оновлення потрохи рухають модель все вище у рейтингу artificialanalysis й наближують до найкращіх.
DeepSeek V4-Pro 0813
https://api-docs.deepseek.com/updates/
13 серпня Pro-рівень нарешті отримав той самий агентний post-training, що вже був у V4-Flash 0731 — і це вже повноцінний production-реліз, а не preview. Операційно додали підтримку OpenAI Responses API, нарешті one-click налаштування Codex і керування рівнем reasoning (low/high/max). Ваги для 0813 не публікували.
Gemini 3.7 Flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Google 13 серпня, за три тижні після 3.6 Flash. Найбільший стрибок усієї Flash-лінійки саме в кодінгу: DeepSWE v1.1 з 49.0% до 65.3% (якщо вірити тестам), FrontierCode 1.1 Main з 34.4% до 43.6% а в таблиці Google це краще за Claude Sonnet 5 і GPT-5.6 Terra - оце так. Додатково майже вдвічі дешевша на старті ($0.75/$3.75 за M токенів до кінця 2026), контекст 1M.
GLM-5.3
https://z.ai/blog/glm-5.3
Z.ai 14 серпня, та сама 743B база, що й GLM-5.2, всі здобутки — з post-training (IndexShare + SAO). Код: +50% на внутрішньому Z.ai Code Bench, Terminal-Bench 3.0 28.3% (найкращий показник серед open-weights, для порівняння GLM-5.2 мав 4.6%), DeepSWE 1.1 66.9%. Говорять, що кіберспроможність (CyberGym 84.5%, ExploitBench з 24.4% до 54.4%) настільки зросла, що випуск вагів затримали на два тижні для safety-перевірки. Поки лише GLM Coding Plan та ZCode.
Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
Alibaba 14 серпня, щільна (dense) мультимодальна 27B-модель під Apache 2.0 — дистиляція флагманського Qwen3.8 Max для локального запуску. Все тести показують помітний ріст над Qwen3.6-27B, чого ми й чекали. Рідний контекст 262K (розширюється до 1M через YaRN), тягнеться на звичайних топових GPU та Ryzen AI Max.
MAI-Code 1.1 Flash
https://microsoft.ai/models/mai-code-1-flash/
https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot/
Microsoft 11 серпня оновила свою невелику код-модель (MoE з ≈5B активних) і запустила в GitHub Copilot. Оновлення зроблене під реальні скарги розробників, тому дотягнули +22% на Terminal-Bench 2.1 і +15% на .NET, плюс native vision (розуміє скріншоти й діаграми). Для рутинних легких задач стало важливішим інше: на 25% ефективніша за токенами і вчетверо дешевша (на 73% нижчий список, ніж у 1.0) — тренована з нуля на чистому enterprise-датасеті без дистиляції.
Muse Glimmer
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
Meta 10 серпня вперше за 16 місяців (після Llama 4) випустила знову open-weights модель — 30B під Apache 2.0, дистиляція закритого Muse Spark для локального запуску на одній споживчій GPU (4-bit квантування ≈ 17GB VRAM). Для коду лідирує в своєму класі за агентними задачами, але програє Qwen3.6-27B (а там вже 3.8 вийшла). Цікаво, що разом з нею Цукерберг пообіцяв колись відкрити ваги і більш потужної Muse Spark 1.2.
#newllmmodel #grok #gemini #deepseek #glm #qwen #microsoft #meta