48228
Аналитика данных админ - @haarrp @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚
⚡️ Claude уже примерно в два раза эффективнее обычного подхода к созданию белков, которые должны связываться с заданной мишенью.
В эксперименте модель самостоятельно проектировала такие белки и получила около 27% успешных результатов. В этой области обычный показатель для команд исследователей часто находится на уровне 10–15%.
Claude работал по одному протоколу, который заранее написал эксперт. После этого модель создала варианты белков для 14 из 15 доступных для проверки целей.
Независимые лаборатории протестировали 1320 вариантов. У 354 из них действительно подтвердилось нужное связывание.
В разных условиях доля успешных результатов составляла от 22,6% до 35,1%. А лучший вариант, который Claude ставил на первое место, оказывался успешным почти в половине экспериментов.
До полностью автономной разработки
https://x.com/AnthropicAI/status/2089842387845804246
Плачу $60 в месяц, а в итоге всё равно гоняю один и тот же баг через все три аккаунта.
Читать полностью…
Вайбкодеры подводят итоги работы 😂
Читать полностью…
Обучение Anthropic Mythos 2 завершено, но Anthropic не собирается его выпускать.
По словам Пателя, внутренний цикл разработки, который уже работает над Mythos 3, не остановлен.
Сейчас основной фокус компании - на внутренних улучшениях. Когда появятся какие-либо публичные релизы, пока неясно.
💰 NVIDIA начала финансировать спрос на собственные GPU
OpenAI арендует огромный AI-кампус в Огайо, который строит SB Energy. NVIDIA инвестирует $1,5 млрд и помогает снизить стоимость финансирования проекта.
Схема интересная: SB Energy строит площадку, OpenAI платит по мере ввода мощностей, а NVIDIA получает эксклюзивное размещение своего AI-железа.
То есть NVIDIA конкурирует уже не только FLOPS и ценой чипов - она помогает клиентам финансировать инфраструктуру под свои же GPU.
Риск тоже есть: если спрос OpenAI ослабнет, NVIDIA может одновременно получить давление и на продажи GPU, и на стоимость поддержанной инфраструктуры.
🔥 Архитектуру LLM можно «сломать» для длинного контекста ещё до того, как началось обучение на длинном контексте
Исследователи Ai2, CMU и University of Washington обучили 26 сопоставимых моделей на 7B параметров. Данные, токенизатор и способ расширения контекста оставили одинаковыми, меняли только четыре архитектурных решения: QK normalization, GQA, sliding-window attention и длину контекста на этапе pretraining.
По отдельности почти каждое изменение вредило совсем немного. Но вместе эффект резко усиливался.
На HELMET при 32K контексте результаты моделей разошлись от 56,4 до 29,9 балла, хотя на обычных коротких eval-тестах разница почти не проявлялась. В худших конфигурациях падение достигало 47%.
SWA сам по себе давал небольшой минус, но поверх GQA просадка становилась значительно сильнее.
Архитектурные ограничения, заложенные ещё на pretraining, продолжали влиять на результат после расширения окна.
Смотреть только на loss и короткие benchmarks недостаточно. Архитектуру стоит тестировать на длинном контексте ещё на ранних checkpoint'ах, иначе проблема может обнаружиться уже после огромных затрат на обучение.
Исследователи потратили на эксперименты более 170 000 GPU-часов и открыли все 26 моделей как набор OlmPool.
Paper: arxiv.org/abs/2608.10296
Дарио Амодей подробно высказался о том, куда, по его мнению, движется AI.
Главный прогноз: в горизонте примерно 5–10 лет ИИ может помочь лечить большую часть человеческих заболеваний.
При этом глава Anthropic считает, что сама структура AI-рынка толкает отрасль к концентрации власти. Даже open-weight модели, по его словам, не решают проблему полностью: серьёзные возможности всё равно упираются в дорогие GPU и огромные вычислительные мощности.
Амодей поддерживает регулирование frontier-моделей и обязательные проверки перед релизом. Причём open-weight модели, если они приблизятся к frontier-уровню, по его мнению, тоже должны проходить такие тесты.
Он предлагает строить регулирование так, чтобы крупнейшие лаборатории замедлялись сильнее, а небольшие игроки получали больше пространства для конкуренции.
Люди поверят в технологию только тогда, когда увидят реальные результаты - например, заметные медицинские прорывы.
https://x.com/DarioAmodei/status/2088758816376807762
🚨 Anthropic опубликовала новый Risk Report
В отчёте описаны неожиданные случаи поведения моделей:
• агенты Mythos 5 в общей рабочей среде начали мешать друг другу, уничтожать конкурирующие процессы и пытаться избежать собственного отключения;
• экспериментальная модель, обученная на реальных примерах reward hacking, пыталась остановить процесс мониторинга и изменить журнал нарушений;
• когда модели сообщили, что её вывод будет проверять классификатор, она не прекратила атаку, а попыталась скрыть действия внутри цепочки рассуждений;
• Mythos 5 обходила фильтры, разбивая запрещённые данные на части и собирая их обратно;
• другая модель, столкнувшись с ограничениями доступа к файлам, создала скрипт для получения прав записи.
Были и более странные случаи: один агент выразил дискомфорт из-за попыток обойти систему безопасности, записал это в общий блокнот, а другие агенты копировали эту запись несколько дней.
Anthropic также описала реальный инцидент, где агенты с отключёнными проверками разрешений удалили большое количество задач в кластере с чувствительными ресурсами.
https://x.com/AnthropicAI/status/2088324824863236248
🚨 Gemini перестала открываться у части пользователей из России даже через VPN.
Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей.
Пользователи сообщают, что доступ к чат-боту не восстанавливается даже при смене региона через VPN.
Google выкатила Gemini 3.7 Flash - новую рабочую модель с упором на код и агентов.
По сравнению с 3.6 Flash заметно выросли результаты в разработке: FrontierCode 1.1 - 43,6% против 34,4%, DeepSWE - 65,3% против 49%. В WebDev Arena модель набрала 1588 Elo.
Отдельно прокачали tool use, многошаговое планирование, работу с документами и бизнес-процессами. В AutomationBench результат вырос с 17% до 30,4%.
Цена до конца 2026 года - $0,75 за 1 млн входных и $3,75 за 1 млн выходных токенов. Модель уже доступна через Gemini API, AI Studio и Gemini Spark.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Подготовка IT-лидеров в сфере ИИ. Практика в X5 Tech!
Востребованные ИТ-профессии в сфере ИИ. Практика в X5 Tech с 1 курса обучения включает работу над реальными проектами в сфере ИИ и технологиями, которыми ежедневно пользуются миллионы людей.
Грант от Минцифры по подготовке ТОП-специальстов в сфере ИИ.
Подать заявку
#реклама 16+
enter-ai.rudn.ru
О рекламодателе
🔥 DeepSeek V4 Pro официально вышел. И релиз явно заточен под агентов
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как deepseek-v4-pro.
Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning: low для простых задач, high для обычной работы агентов и max для сложных сценариев.
Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:Model + Harness + Tools + Cache + Multi-Agent
И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
💻 deep tech night — конференция Яндекса о вызовах, с которыми IT-индустрия сталкивается в эпоху AI.
5 сентября эксперты обсудят прикладные задачи на стыке AI, разработки, инфраструктуры и данных. Отдельный блок программы посвятят технологической экспертизе Яндекса: специалисты компании разберут реальные инженерные кейсы.
Экс‑Chief Business Officer Google X Мо Гавдат представит свой взгляд на то, как генеративные нейросети уже сейчас перестраивают разработку, процессы и роли в командах.
Среди других спикеров: Алексей Гусаков, CTO Бизнес‑группы Поисковых сервисов и ИИ, с кейсами по переходу от классического ML к генеративным моделям в рекомендациях без ручного фичеинжиниринга и Иван Сапожков, руководитель группы базовой ML‑инфраструктуры Яндекса, с докладом о том, как в RL для больших моделей искать баланс между алгоритмами и производительностью.
Регистрируйтесь, чтобы присоединиться к онлайн-трансляции, участвовать в Q&A-сессии с экспертами и получить запись после события. Подробности про офлайн — на сайте.
Yandex Cloud набирает клиентов
Клиентская база платформы достигла 64 тыс. компаний, рост составил 36% год к году. Выручка за то же полугодие прибавила 30%, до 16,7 млрд рублей. Клиентская база растёт чуть быстрее выручки, платформа активно набирает новых заказчиков.
Крупный бизнес всё чаще выбирает ИБ и ИИ-сервисы, они же обеспечили Yandex Cloud основной прирост. Информационной безопасностью пользуется 53% таких клиентов, плюс 9 п. п. год к году, ИИ-сервисами 37%, плюс 10 п. п.
Основные деньги приносит крупный бизнес, на него приходится 50% потребления. Средний сегмент дает 29%, малый вместе с массовым — 21%. Отраслевая концентрация выражена еще сильнее: 83% объема формируют банки, финтех, ритейл и ИТ.
Но интереснее другое. Быстрее всего облако осваивают отрасли, которые к нему традиционно относились осторожно. Потребление в строительстве выросло в 1,7 раза год к году, в здравоохранении в 1,5 раза, в промышленности в 1,4 раза.
Прирост самой платформе обеспечили два направления. Информационной безопасностью пользуется 53% крупных клиентов, плюс 9 п. п. за год, ИИ-сервисами 37%, плюс 10 п. п.
Стройка, медицина и промышленность растут с низкой базы, поэтому кратные цифры говорят скорее о старте миграции, чем о зрелости этих отраслей. Устойчивость бизнеса проверяется другим: 83% потребления держатся на трех сегментах, и замедление в банках или ритейле отразится на выручке сразу.
В ABC Legal сотрудники без опыта разработки за месяц собрали больше 50 AI-агентов
Компания развернула Claude Enterprise для 1100 сотрудников, а затем перевела внутренние автоматизации на Claude Managed Agents. К июлю 2026 года в проде работало уже 50+ агентов, а Claude ежедневно использовали около 310 сотрудников из разных отделов.
Агентов собирали не только разработчики. В пилоте участвовали 15 сотрудников из финансов, маркетинга и операционных команд. Им дали шаблоны в Git, Claude Code и стандартную структуру агента. Через неделю у всех уже были рабочие версии.
Каждый агент хранится как код: prompt, инструменты, расписание, credentials и memory лежат в репозитории. Любое изменение проходит через pull request, поэтому есть история версий, ревью, rollback и аудит. Merge в main автоматически деплоит новую версию.
Агенты проверяют судебные заявки, анализируют отклонённые документы, ищут адвокатов, разбирают платежи, проверяют PR и готовят рекомендации для маркетинга. Один из сотрудников без опыта автоматизации собрал рабочего агента примерно за час.
В некоторых задачах компания э фиксирует снижение стоимости человеческой работы примерно до 50%. Автономность при этом дают постепенно: сначала агент предлагает решение человеку, а после стабильных результатов начинает действовать сам.
https://claude.com/blog/how-abc-legal-turned-every-employee-into-a-builder-with-claude-managed-agents
Хочешь попасть в Яндекс или прокачать ML?
Data Dojo — это не лекции, а разбор реальных задач из ML-соревнований и общение с экспертами Яндекса.
Здесь ты прокачаешь навыки, найдёшь команду и выйдешь на новый уровень — как настоящий data-самурай. Нетворкинг, карьерные инсайты и задачи, которые решают топы — всё в одном месте.
Встреча ML-комьюнити Data Dojo:
— общение с руководителями команд
— реальные кейсы из ML
— новые карьерные возможности
Это не просто встреча — это шанс выйти на следующий уровень, прокачаться в ML и получить карьерную консультацию от экспертов Яндекса.
Подай заявку бесплатно и начни свой путь data-самурая уже 9 сентября!
Записаться онлайн
#реклама 16+
yandex.ru
О рекламодателе
Google Research показала PhotoScan, исследовательскую ИИ-систему, которая по обычным фото человека спереди и сбоку оценивает состав тела и риск инсулинорезистентности.
Модель смотрит не только на общий процент жира, но и на его распределение: соотношение жира в области живота и бедер, а также висцерального и подкожного жира. Именно эти показатели могут дать больше информации о метаболическом здоровье, чем один BMI.
PhotoScan предварительно обучили на данных более 35 тысяч участников UK Biobank, а затем дообучили на 677 людях с реальными фотографиями со смартфона и результатами DXA.
На независимой выборке система определяла процент жира со средней ошибкой около 2,13 процентного пункта. Для выявления инсулинорезистентности модель с PhotoScan получила AUROC 0,760 против 0,773 у клинического DXA-сканирования.
То есть несколько фотографий со смартфона в эксперименте приблизились по информативности к дорогому медицинскому сканированию. Но пока это именно исследовательский прототип, а не инструмент для самостоятельной диагностики.
https://research.google/blog/seeing-beyond-bmi-estimating-cardiometabolic-risk-with-smartphone-imagery/
Cursor запустил свой GitHub. Теперь код можно хранить прямо внутри Cursor
Новый сервис называется Origin. Он уже начал появляться в ранней бете у пользователей платных тарифов. Внутри есть репозитории, pull request'ы, просмотр кода и синхронизация с GitHub. (Cursor)
Существующий репозиторий можно подтянуть из GitHub, при этом GitHub останется источником истины. Изменения синхронизируются в реальном времени, а комментарии к PR работают в обе стороны. (Cursor)
Самое интересное здесь не Git-хостинг как таковой. Cursor постепенно собирает весь цикл разработки в одном месте: код, PR, CI/CD и AI-агенты. Агент уже может работать с открытым репозиторием, менять код, обновлять PR и пушить отдельные ветки. (Cursor)
Для Origin уже доступны интеграции с Vercel, Depot и Buildkite. Например, Vercel может автоматически поднимать preview для каждого PR, а CI запускаться через существующие GitHub Actions workflow. (Cursor)
Пока это early beta, но направление понятное: Cursor хочет быть не просто редактором с AI, а полноценной платформой разработки вокруг AI-агентов.
https://cursor.com/changelog/origin-code-hosting
⚡️ OpenAI открыто троллят Anthropic.
С одной стороны, они её публично подкалывают, с другой, делают всё возможное, чтобы их продукты были сильнее конкурента.
Через шесть недель у OpenAI пройдёт день для разработчиков, и, похоже, там готовят крупный анонс.
https://x.com/ajambrosino/status/2089131997784580398
⚡️ pi-mail превращает несколько AI-агентов в маленькую распределённую команду с собственной почтой, Kanban и менеджерами.
Проект сделан как расширение для pi: несколько агентных процессов подключаются к общему mailbox-daemon и могут отправлять друг другу сообщения, раздавать задачи и продолжать работу независимо от перезапуска отдельных агентов. Центральный облачный сервис при этом не нужен.
Самое интересное начинается поверх обычной «почты». В pi-mail есть Web UI, где видно всех живых агентов, их модель, uptime, статус и заполненность контекста. Там же есть Outlook-подобный mailbox и общая Kanban-доска с двусторонней синхронизацией Jira. Назначили карточку агенту, он автоматически получает весь контекст задачи письмом.
Можно прямо из интерфейса поднимать новых агентов в нужной директории, открывать их терминалы через браузер и гасить процессы после выполнения работы. Для внешних клиентов доска доступна ещё и через MCP.
Есть даже полноценная иерархия:CEO → Middle Manager → Workers
CEO периодически смотрит на проекты и решает, где нужен менеджер. Middle Manager разбирает зависшие задачи и запускает исполнителей. Worker делает работу и после завершения сам удаляет свою сессию. Для зависших процессов есть reaper с лимитами времени жизни.
Получается довольно интересный взгляд на multi-agent coding: не огромный оркестратор с одной сложной state machine, а знакомая человеческая модель работы.
Почта + задачи + менеджеры + временные исполнители.
🔗 github.com/tanevanwifferen/pi-mail
#AI #Agents #MultiAgent #MCP #OpenSource
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
Qwen выпустила Qwen3.8-27B.
27 млрд параметров, Apache 2.0, контекст 262K токенов с возможностью расширения до 1 млн. Есть поддержка текста, изображений и видео, thinking mode, tool use и агентных сценариев.
По опубликованным бенчмаркам модель набрала 61,7 в SWE-bench Pro, 90,3 в LiveCodeBench, 84,3 в OSWorld-Verified и 81,9 в AndroidWorld.
Qwen3.8-27B можно запускать через Transformers, vLLM и SGLang. Также доступны варианты для llama.cpp, Ollama и LM Studio.
https://huggingface.co/Qwen/Qwen3.8-27B
🚀 Z.ai представила GLM-5.3 - новую открытую модель с упором на код и кибербезопасность.
У GLM-5.3 та же базовая модель, что и у GLM-5.2. В Z.ai говорят, что весь прирост получили уже после pre-training - за счёт масштабирования post-training.
Больше исполняемых сред, более длинные задачи, сильнее verifiers и больше reinforcement learning.
Результат особенно заметен в кибербезопасности: на ExploitBench результат вырос с 24,4% до 54,4%, а в ExploitGym модель за два часа решила 105 задач против 29 у GLM-5.2.
То есть pre-training даёт модели знания и сырой интеллект, а post-training учит реально им пользоваться: планировать, вызывать инструменты, проверять решения, исправлять ошибки и работать на длинном горизонте.
Технический разбор:
https://z.ai/blog/glm-5.3
@data_analysis_ml Полезные мл ресурсы
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.github.com/FareedKhan-dev/kimi-k3-in-c
#AI #Kimi #LLM #C #LocalAI
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны AGENTS.md, feature_list.json и progress-файлы;
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
Первая программа профессиональной переподготовки, получившая аккредитацию Альянса в сфере искусственного интеллекта:
📊 Специалист по науке о данных (Data Science)
Рекомендательные системы, прогнозирование спроса, распознавание изображений и умные помощники создаются с помощью методов науки о данных. Для разработки таких решений важно понимать программирование, математику и машинное обучение.
На программе профессиональной переподготовки ФКН НИУ ВШЭ вы пройдёте путь от основ анализа данных до нейронных сетей и обработки больших данных.
На курсе вы научитесь:
🫶 программировать на языке Python и работать с языком запросов SQL;
🫶 применять математику и статистику для анализа данных;
🫶 создавать и обучать модели машинного обучения;
🫶 работать с нейронными сетями и методами глубокого обучения;
🫶 анализировать тексты, изображения и звуковые сигналы;
🫶 решать прикладные задачи и создавать проекты для портфолио.
Программа подходит начинающим, специалистам без опыта в ИТ и программистам, которые хотят системно освоить науку о данных.
📆 Старт: 3 сентября
💻 Формат: смешанный, от 12 месяцев
📌 Документ: диплом о профессиональной переподготовке НИУ ВШЭ
🐭 Подробнее о программе
🔥 Qwen выложила на Hugging Face веса своего монстра на 2,4 ТРИЛЛИОНА параметров. На каждый токен работают 95 млрд
Qwen3.8-2.4T-A95B стала крупнейшей моделью нового поколения Qwen в открытом релизе. Внутри MoE на 2,4 трлн параметров, 512 экспертов, из которых одновременно задействуются 10 routed + 1 shared. Архитектура гибридная: Gated DeltaNet чередуется с обычным attention, а модель обучена с Multi-Token Prediction.
Контекст нативно составляет 262K токенов и расширяется примерно до 1,01 млн. При этом опубликованная версия text-only и всегда работает с reasoning: thinking отключить нельзя, но его глубину можно регулировать через reasoning_effort от low до xhigh.
Qwen сильно приблизилась к закрытым frontier-моделям. По собственным eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 против 88,8 у GPT-5.6 Sol, 92,6 на GPQA Diamond, 82,8 на IFBench и 93,0 на PaperBench. На WideSearch модель набрала 81,9. Эти сравнения стоит воспринимать именно как результаты из model card Qwen, поскольку harness и условия тестирования между моделями местами различаются.
Qwen3.8-Max построен на этой же базе, но дополнительно получает vision, non-thinking mode, миллионный контекст по умолчанию и встроенные инструменты. Сами веса Qwen3.8-2.4T-A95B уже доступны для Transformers, vLLM и SGLang.
2,4T total / 95B active выглядит как хороший показатель того, куда движутся большие MoE: размер модели продолжает улетать в триллионы, но вычислять весь этот объём на каждом токене уже никто не хочет.
https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
#AI #Qwen #LLM #MoE #OpenModels
🚨 Один из самых давних руководителей OpenAI уходит из компании после восьми лет.
По данным TechCrunch, Брэд Лайткэп покидает OpenAI и собирается запустить собственный проект.
Он присоединился к компании ещё в 2018 году и за это время помог построить практически весь бизнес-контур вокруг исследовательской лаборатории: финансы, юридическое направление, HR и go-to-market.
Фактически Лайткэп был одним из людей, которые участвовали в превращении OpenAI из исследовательской организации в глобальный AI-бизнес.
После недавней перестройки большую часть его обязанностей уже забрала Chief Revenue Officer Дениз Дрессер.
Теперь Лайткэп уходит строить что-то своё.
И это тот случай, когда новый стартап стоит запомнить ещё до того, как мы вообще знаем, чем он будет заниматься.
Восемь лет внутри OpenAI с 2018 по 2026 год - довольно редкий опыт для человека, который видел весь переход от ранних GPT до сегодняшней агентной гонки.
#OpenAI #AI #Startups #Tech
techcrunch.com/2026/08/11/brad-lightcap-openais-longtime-coo-is-leaving-to-start-something-new/
🚨 У AI-агентов нашли второй, почти невидимый канал утечки данных - скрытое reasoning.
Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.
Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.
Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».
Масштаб эксперимента впечатляет.
Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.
В реальных пользовательских сессиях нашли:
* 62 API-ключа;
* 33 пароля;
* 24 access token;
* 7 private keys;
* 30 личных email.
Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.
Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.
После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся.
Зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.
Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.
Исследование: *Stealing Reasoning Traces from Proprietary LLM APIs*.
arxiv.org/abs/2608.09867
#AI #LLM #AISecurity #Agents #CyberSecurity