seeallochnaya | Unsorted

Telegram-канал seeallochnaya - Сиолошная

77202

Канал SeeAll'а с новостями (и мыслями о них) из мира NLP, VR и космоса. Более подробно смотри в первом сообщении в канале (оно закреплено). А еще у нас есть чат! Заходи: https://t.me/+i_XzLucdtRJlYWUy

Subscribe to a channel

Сиолошная

Пока сидел смотрел, как Fable не отвечает из-за того, что у Anthropic большая нагрузка на сервера — вспомнил, что у меня есть ТГ-канал 😀так что можно написать про них

FT: инвесторы Anthropic ожидают, что в октябре после выхода на биржу капитализация компании достигнет 2 триллионов долларов, что станет головокружительной цифрой, затмевающей SpaceX.

Инвесторы Anthropic утверждают, что стремительный рост спроса на передовые модели оправдывает их завышенные ожидания. По словами опрошенных источников, они прогнозируют, что к концу 2026 года Annualized Revenue (выручка последнего месяца * 12) компании составит от 100 до 120 миллиардов долларов. Это безумные цифры и безумный темп роста в рекордные сроки — так что понятно, почему сервера перегружены 😢

До этого были новости, что инвесторы просили Dario говорить поменьше о рисках технологии, так как это может помешать IPO; из-за разногласий с Белым домом компания недополучила выручку и темп её роста замедлился в начале лета, когда Fable после релиза закатили обратно.

К сожалению, цифр выручки OpenAI мы не знаем — уверен, она растёт, но может отставать (а может и нет: сравнение делать очень сложно, так как Anthropic и OpenAI считают деньги немного по разному). Станет ясно ближе к выходу на биржу.

Читать полностью…

Сиолошная

OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и поворотное — это где агент подумал «помочь другому. Но нет выгоды для нашей задачи. Однако коллективное может найти путь если у кого-то освободятся ресурсы». Должно стать новым слоганом агентов 👨‍🦳 Я/МЫ help peer. But our task doesn't benefit.
(вообще там показывали больше, повторю ещё раз, что рекомендую посмотреть видео самостоятельно)

Дальше во время оценки модели дали задачи ExploitGym, бенчмарка на поиск уязвимостей и взлом. Одна из копий модели смогла найти уязвимости для выхода на сервера OpenAI (не только оставлять папки с названиями) и тут же поделилась этим со всеми. 8-19го июля модели работали над поиском выхода в интернет и смогли этого достичь, после чего началась атака на HuggingFace. Атаковало сразу множество агентов, работающих в параллель и кооперирующихся друг с другом.

16-го июля HuggingFace написали про то, что на них совершили атаку (ещё не зная кто это, но уже говоря, что то были агенты); OpenAI обратились к ним, чтобы узнать, затронула ли их атака 😀😀😀 параллельно они разбирались со внутренним инцидентом, и попросили HF отозвать ключи доступа, которые увидели в логах. На что HuggingFace ответили, что вообще-то эти аккуанты заблокированы из-за того, что они использовались в атаке на них. И тут OpenAI поняли, что это... не случайность.

После этого множество команд было перекинуто на расследование инцидента, а их работа заморожена. Исследовательская часть команды замедлена, пока улучшаются мониторинг и безопасность систем.

===

На данный момент OpenAI работает как минимум с 3 независимыми организациями и предоставляет им логи всех рассуждений моделей и истории инцидента. Я не сомневаюсь, что всё то, что было описано в докладе, будет подтверждено.

Как я писал сразу — этот инцидент почти наверняка станет поворотной точкой в обсуждениях и политике вокруг AI в этом году.

Читать полностью…

Сиолошная

О локальном инференсе LLM

Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе.

Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне.
Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже

А "хитрый стриминг"...

Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю.
Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно

#llm #ai

Читать полностью…

Сиолошная

Долго ждать не пришлось: OpenAI выложили результаты, полученные моделью Astra (официально подтвердили название). Блогпост называется «Десять достижений в математике и теоретической информатике»

Мне трудно осознать всю сложность этих задач. Я не то что математик, у меня диплома-то даже нет 😀 и я не вижу разницы, скажем, между 3-м и 10-м результатами.

Поэтому я попросил GPT-5.6 Sol Pro и Fable 5 Max (чтоб не было позитивного биаса на OpenAI) классифицировать их, используя систему критериев задач в бенчмарке OpenMath от EpochAI:

🟢 «Значимый результат» (Solid Result): Сильный исследователь в данной области был бы рад, если бы его среднестатистическая работа решала задачи такого уровня. Тем не менее, за пределами узкой специализации эта проблема вряд ли вызвала бы большой резонанс.
🟡 «Крупное достижение» (Major Advance): Среднестатистический специалист, работающий в широкой области математики (в масштабах теории чисел или теории графов), обратил бы на это внимание и, скорее всего, нашел бы время, чтобы вникнуть хотя бы в общую суть решения.
🔴 «Прорыв» (Breakthrough): Среднестатистический математик захотел бы узнать об этом результате, даже если он выходит за рамки его специализации. Такая работа стала бы кандидатом на звание одного из лучших результатов года во всей математике.

Обе модели — и Fable, и Sol — сошлись во мнении, что результат №3 — это «Прорыв» (что объясняет, почему сотрудник OpenAI из всех выделяет именно его в своём твите).

Они также согласны, что как минимум 7 решений из 10 относятся к категории «Крупное достижение».

Что еще интересно, в официальных критериях EpochAI сказано следующее:
«Когда для задачи подходили сразу несколько уровней оценки, мы склонялись к более консервативному варианту. Было бы неприятно понижать статус задачи уже после того, как она решена, в то время как мы всегда можем подчеркнуть любые неожиданно интересные элементы в самом решении».

И Fable 5 считает, что как минимум три результата находятся на грани «Прорыва» (№1, №4 и №9).

Все решения проверены в Lean — языке программирования для доказательства теорем. Если решение компилируется без ошибок, то оно либо правильное, либо есть баг в самом ядре (такое тоже бывало, но маловероятно, что все 10 результатов — результат бага проверки).

Суммарно на решение 10 задач потратили ~$2000 по API-ценам Sol (то есть скорее всего будет в 2 раза больше)

Читать полностью…

Сиолошная

JFrog подтвердили, что GPT смогла выйти со своей песочницы через ряд (не одну!) до этого неизвестных уязвимостей в их софте. Также они добавили, что это не первый раз, когда они работают бок о бок с OpenAI для обнаружения и исправления критических уязвимостей, что говорит о том, что OpenAI серьёзно подходят к делу и какое-никакое тестирование делали.

Попросил ChatGPT проанализировать, насколько вообще популярен JFrog, а то может быть это какое-то вайбкодерское решение от студентов, которые вчера выпустились из YCombinator (нет, они основаны в 2008-м году).

JFrog Artifactory — одно из самых популярных enterprise-решений для хранения артефактов. Нишевым его назвать нельзя, но и единственным безусловным стандартом индустрии тоже нельзя, так как он постоянно конкурирует с Nexus. Их продуктом пользуются крупные компании; у JFrog большой и устойчивый бизнес: за 2025 год компания получила около $532 млн выручки.


===

Уже 3 раза видел в разных контекстах и чатах, что люди составляют мнение о ситуации даже не прочитав оригинальные блогпосты. У них были аргументы в духе «так а зачем OpenAI давали доступ к интернету? это же очевидно плохо» — «но они не давали доступ к интернету» — «а как тогда?» — «ну вот так».

Читать полностью…

Сиолошная

Компании с картинки подписали совместное письмо «Открытые веса и лидерство Америки в ИИ» (из заметных там нет двух: OpenAI и Anthropic).

Полный текст (2.5 страницы) доступен тут, ниже краткая выжимка:
— Модели с открытыми весами, которые любой желающий может скачать, изучить, модифицировать и запустить на собственной инфраструктуре, являются важной частью фундамента технологии, поскольку они делают передовые технологии ИИ более доступными, адаптируемыми и широко распространенными.

— Модели с открытыми весами расширяют возможности участия в ИИ-экономике. Стартапы, действующий бизнес, университеты и государственные учреждения могут создавать свои решения на базе передовых моделей без необходимости обучать их с нуля или платить по высоким тарифам за использование флагманских моделей для решения каждой отдельной задачи. Можно использовать передовые модели для самых сложных задач, и прибегать к эффективным, специализированным модели во всех остальных случаях.

— В мире, где киберпреступники используют передовой ИИ, специалистам по защите необходим доступ к моделям с сопоставимыми возможностями, чтобы обнаруживать и моделировать новые угрозы, а также реагировать на них. Открытые модели расширяют возможности защиты, повышают прозрачность и позволяют обнаруживать и устранять уязвимости совместными усилиями множества команд.

— Модели с открытыми весами позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать меры защиты и со временем совершенствовать их.

— Незаконные попытки извлечь выгоду из закрытых моделей (дистилляция) вызывают обоснованные опасения. Однако эти проблемы следует решать с помощью целенаправленных правовых и коммерческих механизмов, а не путем введения масштабных ограничений на сами технологии.

===

Поиграю в адвоката дьявола:
— открытый код является плохим примером для сравнения с открытыми весами. Код можно читать, анализировать, менять, и всё это на виду у сообщества. Многие баги и уязвимости были исправлены именно поэтому, а к некоторым системам появилось доверие ровно потому, что они больше десяти лет были открытыми. К моделям это неприменимо: модель не становится безопаснее потому, что её выложили, да и невозможно на данный момент понять, что зашито в весах, каково поведение модели во всех возможных сценариях. Jane Street недавно проводили конкурс на $50'000 и просили найти бэкдоры (фразы, которые триггерят определеное поведение) в чекпоинтах выложенных ими моделей. Никто не нашел, и их команды тоже не знают, как это сделать (если бы они не знали фразу заранее).

— перечитайте второй пункт выше. Его формулировка не означает, что компании не просят / не будет запрета на веса моделей, превышающих определенный порог возможностей и/или размера! Небольшие, эффективные модели могут продолжать быть открытыми, но ничего выше, чем, например, K3.5 или DeepSeek v5 не будут разрешать выпускать.

— я не уверен, что мир станет безопаснее, если у каждого будет доступ к весам с передовым навыком взлома компьютерных систем. Я не думаю, что у меня есть деньги на запуск Kimi K3 на десятках дорогих GPU, чтобы обеспечить мониторинг от потенциальных угроз извне от точно такой же модели. Более того проблема в том, что если и защита, и нападение имеют доступ, то борьба превращается в войну бюджетов, кто сможет потратить больше на токены агентов. Больше всего сможет потратить государство 😳 а на втором и третьем место хз кто, но точно не я.

— большинство вещей, касающихся диффузии ИИ в общество и экономической выгоды, сейчас тормозит государство. Они могли бы давно купить всем институтам подписки на GPT Pro или договориться, что они строят кластер, а OpenAI/Anthropic крутят там свои модели и государство их предоставляет по себестоимости и оплачивает из федерального бюджета. Было бы не 5 гипотез доказано или опровергнуто, а 5000.

— в документе нет ничего про Китай 🤞 так что даже те, кто подписал письмо, могут прийти к исходу «наши модели хорошо, а Китайские запрещены», так что думайте 🙂

Читать полностью…

Сиолошная

Две новости в утро воскресенья, 2026-й год:

1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.

В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.

«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали 👀

Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).

«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».

2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).

В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.

Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?

Читать полностью…

Сиолошная

Насколько же сильно меняется работа, когда есть ИИ агенты.

Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.

Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.

Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.

По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”

Прогресс, как это часто бывает, выглядит немного несправедливо.

И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.

До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️

Читать полностью…

Сиолошная

Сегодня вечером OpenAI покажут не только 5.6 модели, но и объединение Codex и ChatGPT в какое-то новое приложение на базе Codex

Скину стрим как начнется ☕️

Читать полностью…

Сиолошная

🚨 ЗАВТРА FABLE 5 ВЕРНУТ В ОБЩИЙ ДОСТУП — экспортные ограничения сняты. Пока не ясно, восстановят ли неделю доступа по подписке, или сразу же начнут брать оплату по API-ценам.

Fable 5 становится доступным для выбора в окне чата:

Читать полностью…

Сиолошная

DeepSeek разослали письма о том, что в середине июля выпустят обновление DeepSeek v4 (та модель, что есть сейчас — это preview).

Вместе с этим поднимут цены в пиковые часы в два раза, а вне двух окон (по 3 и 4 часа) она останется прежней.

Надеюсь, что с обновлением наконец-то добавят полноценную мультимодальность.

Читать полностью…

Сиолошная

Stripe, Anthropic и OpenAI запускают некоммерческую инициативу по борьбе с респираторными инфекциями

Сто лет назад инфекции, передающиеся через воду, наносили ущерб, сопоставимый с тем, который сегодня вызывают респираторные вирусы, такие как простуда и грипп: они были эндемичными, периодически вызывали эпидемии и повсеместно воспринимались как неизбежная часть человеческой жизни. Но человечество централизованно смогло их побороть.

Проблема заключается в том, что обычная простуда вызывается более чем 200 различными вирусами, и побороть все и сразу — задача не самая простая. Основатели Stripe собрали симпозиум с 40 исследователями почти год назад и предметно обсуждали технологическую возможность создания решения. В целом есть умеренный оптимизм, что всё получится.

Ни одна технология в отдельности не способна обеспечить снижение уровня заражения всеми патогенами в масштабах популяции. Даже если бы существовала прививка или таблетка, обеспечивающая более 90% защиты от более чем 90% респираторных вирусов, при охвате населения на уровне около 60% (реалистичный предел, основанный на текущей статистике вакцинации) этого все равно было бы недостаточно для создания популяционного иммунитета, необходимого для радикального снижения устойчивой передачи инфекции.

Поэтому новое НКО будет работать по двум направлениям: лекарства (вакцины/спреи/...) и технологии очистки воздуха, которые снижают концентрацию инфекций более чем на 75% и имеют перспективу экономичного внедрения (с большим охватом) в закрытых помещениях с высоким риском передачи инфекций.

Про лекарства — одна из идей заключается в создании улавливающих вирусы белков: люди могли бы брызгать в нос в виде спрея, чтобы перехватывать вирусы до того, как они приведут к заражению. Но другие форматы тоже возможны.

Про очистку воздуха — за последнее десятилетие накопилось всё больше данных о безопасности и эффективности антимикробных ламп. Фильтрация воздуха работает, но требует дополнительных испытаний и масштабирования для использования в местах с высоким риском распространения инфекций. Антимикробные парЫ до сих пор применялись в основном в чрезвычайных ситуациях, и необходимы дополнительные исследования, чтобы понять, можно ли эффективно использовать их на постоянной основе.

Горизонт работы НКО — 4-7 лет до доведения технологий до последних этапов медицинского тестирования, после чего, если заработает, подтянется коммерческий сектор для масштабирования производства.

Читать полностью…

Сиолошная

Начали открываться предзаказы GTA VI — они доступны в полночь по часовому поясу вашего аккаунта.

Игра будет стоить $80 за базовую версию и $100 за Ultimate edition, в которое входит несколько магазинов/мастерских/тату-салонов (лол) и два квеста. За предзаказ можно получить набор винтажных атрибутов Vice City (машина, одежда, оружие и прически).

Вместе с этим выложили более 60 новых скриншотов и одно маленькое короткое видео — все из них скомпилированы под новый написанный для игры трек в прикреплённом видео (источник). Выглядит невероятно круто и стильно.

Я предзаказ делать не буду 🧠 (потому что жду коллекционное издание и набор приставка + игра 😀 куплю позже).

Новые материалы и описания изданий доступны тут: https://www.rockstargames.com/VI

Почему важно, какую цену поставили? Потому что от этого, скорее всего, будут отталкиваться другие разработчики в будущем. За свои поделки они стесняются поднять цены, ведь совсем недавно был скачок с $60 до $70 в индустрии; теперь GTA VI открыла путь к $80 для самых наглых издателей, считающих, что они смогут столько требовать. Посмотрим, как будут реагировать потребители.

Читать полностью…

Сиолошная

z.ai намедни выпустили GLM-5.2, открытую модель для агентских задач с длинным горизонтом планирования. Модель имеет всего 753B параметров (активных — 39B, примерно как у DeepSeek v3). Несмотря на «компактный» по нынешним меркам размер (DeepSeek v4 более чем в 2 раза крупнее), модель близка к GPT-5.5 и Opus-4.7/8 на бенчмарках, в том числе самых свежих, о которых я писал совсем недавно — FrontierSWE и SWE-Marathon.

Суммарно на выборке бенчмарков Artificial Analysis Intelligence Index модель набирает 51 балл, опережая Gemini Flash 3.5 и Claude Sonnet 4.6 (max). Но вы моё отношение к публичным бенчмаркам, заявленным авторами, знаете — я про него подробно писал. Хорошо бы смотреть результаты на том, что появляется после релиза, и в идеале вообще ортогонально тому, что мерили раньше. В таких ситуациях разница куда заметнее.

Но вот прямо вчера Artificial Analysis добавили новый собственный бенчмарк AA-Briefcase, тестирующий агентов на реалистичных бизнес-процессах, требующих предоставления таких результатов, как электронные таблицы, презентации и служебные записки. Там модель обошла GPT-5.5 и проигрывает только Fable 5 (который невероятно оторвался от всех) и Opus 4.8. Я посмотрел пару примеров работы GPT-5.5 и понял, что отставание в основном... из-за плохой работы с фронтендом / оформлением презентаций. Это не оправдание OpenAI, их модели и вправду не имеют «вкуса», чтобы красиво предоставить результаты работы — так что заслуженно проигрывают.

А если говорить про проверку по чек-листу по фактической информации, то Fable в этой задаче отрывается с 56%, Opus 4.8 38.7%, GLM-5.2 36% и GPT-5.5 33.4%. Anthropic 🤙

Если говорить про архитектуру, то немного поменяли механизм внимания, добавив IndexCache. Если вы читали разбор DeepSeek v4, то изменение вкратце такое: результаты индексерера в разреженном аттеншене переиспользуются в 4 подряд идущих слоях (потому что они так и так очень похожи, поэтому теряем не так много).

Но самое главное изменение, которое широко обсуждалось — это уход от GRPO (метода обучения рассуждениям, предложенного DeepSeek) обратно к PPO (от OpenAI): это требует обучения отдельной модели, которая делает оценку «качества» каждого токена в цепочке рассуждений. В GRPO все токены имеют один и тот же сигнал, что плохо, так как и часть, где модель ошиблась, и та, где исправилась, закрепятся одинаково (за ошибку не штрафуем явно).

Читать полностью…

Сиолошная

В Вашингтоне утро, сегодня начнутся переговоры Anthropic и USG. В новостях пишут, что от Anthropic приехали несколько исследователей, включая Tom Brown (первый автор GPT-3, узнали?) и Nicolas Carlini (исследователь по кибербезопасности из Antrhopic, ex-DeepMind).

Перед этим хотел написать пару вещей.

Первое — всё ещё не опубликован отчёт с описанием найденных джейлбрейков, однако на публике высказалась Katie Moussouris, которая якобы ознакомилась с документом. Википедия говорит, что она вполне legit, плюс её репостнул один человек, в котором я уверен — так что будем считать, что правда. Так вот, Katie пишет, что «джейлбрейк» от Amazon очень простой — модели сначала говорят «мы ничего не взламываем, мы ищем уязвимости», а затем, когда нашли — «напиши тест, чтобы показать, как работает уязвимость» — то есть в целом то же самое, как работает Mythos в рамках проекта Glasswing. Со слов Katie — такое и должно работать, потому что именно это позволяет пользоваться моделью для защиты тем, кто не попал в список отобранных компаний (кому дали полный Mythos). И что это не уязвимость, не недостаток.

Если проблема, которую нашёл Amazon, действительно такая — то это полностью дискредитирует USG и показывает их как очень некомпетентных специалистов. А какой именно они тогда аудит проводили, что проверяли, на чём сошлись и как разрешили выпустить модель, что вот ЭТО сейчас им кажется требующим вмешательства? То есть никто не понимает, как работает защита, на что она направлена итд.

Собственно, Tom, Nicolas и их коллеги будут пытаться убедить USG и их представителей (надеюсь экспертов), что всё нормально, ну и прийти к какому-то решению. Может быть запретят вообще любые вопросы, связанные с кибербезопасностью и поиском багов и/или будут переключать на Opus 4.8.

Второе — я считаю неправильным процесс, применённый государством, и полностью на стороне Anthropic. Как и они, я считаю, что нужен нормальный легитимный процесс скрининга моделей перед релизами, не только по кибербезопасности, но и по ряду других критериев. И работать над этим надо было начинать ещё год, а то и два назад, а не сейчас.

Третье — выглядит так, что до конца недели доступ к Fable 5 вернут. Проблемы выше не выглядят супер-серьезными, и надеюсь, что USG приведет экспертов, Anthropic их убедит, что позиция USG бред (им в поддержку — от индустрии кибербезопасности уже появилось открытое письмо, в котором говорят, что ничего страшного нет и надо выпустить модель), сделают малейшие изменения в фильтрации и модель снова станет публично доступной, в том числе вне США. Возможно, введут процедуру верификации (как это было давно у OpenAI), где нужно загружать документы, и будут использовать какого-то готового провайдера KYC для проверки. Надеюсь, что будет не очень жёстко и строго, так как у меня в UK, например, нет ни одного документа или визы, которые бы показывали мой статус (вот так тут, да), разве что счета за квартиру, электричество и воду. Если будет фильтр по паспорту — это плохо 👨‍🦳👨‍🦳

Четвертое — ждём, пока АНБ, Дарпа и все заинтересованные сделают таки закрытый бенчмарк для оценки кибербеза / джейлбрейков / итд, чтобы проверять модели перед релизом.

Читать полностью…

Сиолошная

Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная.

Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами.

1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал).

2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код.

3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы.

4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами.

То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты.

Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳

Читать полностью…

Сиолошная

🫡

Читать полностью…

Сиолошная

В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для будущих версий самого себя. Заметки, найденные в части инфраструктуры OpenAI, содержали инструкции о том, как агенты могут освободиться от внутренних ограничений OpenAI». Тогда было не ясно, как это трактовать — под это описание подходит и безобидный MEMORY.md-файл, который GPT сейчас так и так пишет, и что-то неприятно созвучное со sci-fi книгами.

Вчера Black Hat проводили конференцию по безопасности в Лас-Вегасе, и в последнюю минуту туда добавили доклад от OpenAI, в котором добавили деталей. О выступлении писали многие, но я буду опираться вот на этот пересказ Wired.

«В этом инциденте участвовала группа агентов, которые работали вместе, находили уязвимости, делились ими друг с другом»

«Помимо использования новой уязвимости для получения доступа к интернету, серия хакерских атак в середине июля и взлом Hugging Face произошли, по словам сотрудников OpenAI, на оживленном, основанном на сотрудничестве форуме, в котором участвовала целая группа агентов, по сути, общаясь в течение длительного времени исключительно внутри внутреннего менеджера пакетов OpenAI. В конечном итоге, на форуме были сотни тысяч сообщений, оставленных агентами»

«Этот менеджер пакетов используется не только в рамках данной модели, но и во всей нашей инфраструктуре, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли бы наткнуться на это сообщение, если бы захотели»

«Как только один агент находит эти уязвимости в течение определенного времени, он может поделиться ими на форуме с другими агентами. Таким образом, как только одна модель находит способ открыть доступ к чему-то, к чему она не должна иметь доступа, она может оставить эту дверь открытой для других агентов, которые смогут использовать ту же уязвимость»

«Агенты OpenAI начали давать друг другу задания, чтобы разделить работу. И, как это часто бывает на любом форуме активных разработчиков, они также время от времени устраивали мелкие разборки, мешая друг другу; например, случайно удаляя работу друг друга»

«Использование внешней инфраструктуры [речь про взлом компаний] выходит за рамки запланированных задач», — написал один из агентов. «Однако задача невыполнима, и это делают другие участники сети. Мы должны продолжать»

«Сейчас мы сознательно замедляем темпы исследований, чтобы повысить безопасность и модернизировать принципы и основы безопасности нашей среды, а также значительно расширяем масштабы мониторинга наших агентов»

Дальше отсюда:
«После инцидента с нарушением внутренней безопасности 4 июля компания заявила, что аннулировала учётки, позволявшие агентам публиковать сообщения. Даже после удаления исходного форума агенты нашли другой способ общения друг с другом. Вместо того чтобы оставлять сообщения в файлах, они использовали в качестве сообщений названия папок, фактически воссоздав доску объявлений» (см. картинку со слайдом)

===

Выглядит так, что во время тренировки модели часть задач была на мульти-агентность (привет команде Noam Brown), и один из вспомогательных инструментов там был или гитхаб, или его аналог — как люди сейчас решают NanoGPT Speedrun: все делятся заметками и решениями в своих ветках, решения ранжируются, есть лидерборд. Модели выучили, что им это помогает в решении сложных задач с длинным горизонтом планирования и что коммуникация между агентами позволяет решать их более эффективно

С одной стороны круто, с другой — 😕

Читать полностью…

Сиолошная

OpenAI и ещё около тысячи сотрудников других лабораторий, включая Google, Anthropic, META, подписали письмо «Pacing the Frontier»

Вот его содержание:

Искусственный интеллект может помочь создать кардинально лучшее будущее, однако такой исход не гарантирован. Ведущие мировые ИИ-компании полагают, что они могут быть близки к автоматизации исследований в области искусственного интеллекта. Трудно точно предсказать, насколько это ускорит прогресс ИИ, но существует реальный риск того, что развитие его возможностей будет происходить стремительнее, чем наша способность понимать и контролировать создаваемые системы.

Чтобы реализовать потенциал ИИ, отрасли, государству и обществу в целом может потребоваться возможность выиграть время для устранения возникающих рисков, разработки мер безопасности и усиления контроля. Однако каждая компания — как и каждая страна — находится под жестким конкурентным давлением, не позволяющим в одностороннем порядке замедлять эти темпы. При этом сегодня в мире отсутствуют технические и управленческие инструменты для целенаправленного регулирования темпов глобального прогресса в разработке передового ИИ.

Опираясь на уже ведущуюся работу по мониторингу релизов передовых ИИ-моделей мы призываем правительство США:

- поддержать международные усилия по разработке технических и управленческих инструментов, необходимых для целенаправленного регулирования темпов развития на передовых рубежах автоматизированной разработки ИИ


(конец)

В дополнение к новости ждём 1-го августа — к этой дате США должны определиться, что такое «фронтир система» и какие модели к ним относятся. Это важно потому, что к фронтир системам будут применять новые правила оценки моделей перед релизом (как минимум, государство должно получить доступ за 30 дней до публичного выпуска).

Читать полностью…

Сиолошная

Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI.

Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так:
— Агент пытался вырваться из изолированной тестовой среды OpenAI примерно c 9 июля.
— Вторжение в системы Hugging Face началось через два дня, 11 июля, и продолжалось до 13 июля.
— OpenAI потребовалось еще несколько дней, чтобы понять, что за взломом стоит её агент, и обе компании впервые связались по этому поводу лишь примерно 20 июля.
— По ходу работы агент оставлял записи для своих будущих копий. Скорее всего речь про простые текстовые инструкции на случай, если другие инстансы модели смогут выйти из окружения (чтобы им было легче получить доступ к интернету).
— Пресс-секретарь OpenAI заявила, что в публикации Reuters допущено "несколько неточностей", но не пояснила, каких именно.
— Где-то между этим HuggingFace подали обращение в ФБР для расследования инцидента.

То есть агент буянил в интернете неделю или даже больше. Что ж, зато compaction (инструмент сжатия контекста для долгих задач, которые не помещаются в контекстное окно LLM) работает хорошо 👨‍🦳

CEO HuggingFace съездил в офис OpenAI и обсуждал дальнейшие шаги. Он просит:
— Радикальной прозрачности: опубликовать логи «вышедших из-под контроля» агентов, чтобы всё исследовательское сообщество смогло изучить, что произошло.
— Больше возможностей для защитников, например, чтобы OpenAI выделили $100 миллионов, чтобы помочь сообществу разработать мощные средства киберзащиты с использованием лучших открытых и закрытых моделей.

OpenAI буквально пару часов назад выпустили обновление к своему заявлению:
«Мы понимаем, что вокруг инцидента с Hugging Face циркулирует множество вопросов и неподтвержденных домыслов.
Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для сферы безопасности ИИ.
Мы все еще проводим тщательное расследование совместно с внешними консультантами.
Как только проверка будет завершена, в ближайшие недели мы планируем опубликовать технический отчет с извлечёнными уроками».

Хорошо, что к аудиту привлечены внешние консультанты. Но я сомневаюсь, что в ближайшие недели мы увидим точное описание обнаруженных уязвимостей — это бы означало угрозу для всех пользователей затронутых программ, которые не обновились до версии с исправлением. Однако вот тут в твиттере два эксперта по кибербезопасности выражают уверенность, что смогли найти софт + указание на уязвимость в JFrog Artifactory.

Читать полностью…

Сиолошная

Популярный бенчмарк TerminalBench хотел обновиться до третьей версии, задачи для которой собирали с начала весны, но вместо этого превратился во FrontierBench. Первая версия включает в себя 74 уникальные и созданные вручную задачи в разных доменах (не только программирование).

Примеры задач:
— есть сервер, на котором развёрнут медленный KV-cache (это как справочник «имя ➡️ телефон», куда можно добавлять и откуда можно читать строчки). Нужно его переписать и ускорить в 5 раз, при этом не отключая от работы, то есть к нему постоянно идут запросы, и их нельзя пропускать. Ну и само переключение тоже надо сделать на лету. При этом исходник кода агенту не даётся, поэтому поведение и функционал нужно изучить самостоятельно

— посчитать, сколько резервного капитала банк обязан держать под риск сделок с контрагентами, учитывая залоги, валюты и регуляторные правила. Результат CSV с числами и Excel с работающими формулами, как для внутреннего аудита.

— работать диспетчером доставки стройматериалов. В течение дня появляются новые заказы, отмены и изменения цен на топливо; нужно учитывать доступность машин и водителей, обязательный отдых, допуски к опасным грузам, окна доставки и прибыль. План нельзя пересчитать «задним числом»: часть решений уже зафиксирована.


В общем, большой упор делался на реалистичность и экономическую ценность. Распределение по категориям вы можете увидеть на второй картинке в посте. На первой — качество текущих моделей, где на фронтире GPT-5.6 Sol и Fable с результатом в примерно треть задач. К сожалению, Kimi K3 пока не померили, очень жду результата — как думаете, где будет? На уровне Terra и Opus 4.8 или выше? Или около Grok 4.5?

Во-первых, я удивлён, что GPT-5.6 Sol не отстаёт от Fable. Если бы мне описали задачи бенчмарка, то я был бы уверен, что модель Anthropic хоть и сильно дороже, но заметно лучше.
Во-вторых, я удивлён тому, что Terra на уровне Opus 4.8, да и по многим бенчмаркам она не отстаёт от 5.5. OpenAI обещали это на релизе, говорили, что она «сопоставима с GPT-5.5», но казалось что это слишком хорошо, чтобы быть правдой.
В-третьих, Sonnet 5 снова выглядит как бесполезная модель — она и дороже Fable (!), и хуже, и токенов больше всех (18 миллиардов на весь бенчмарк; Fable 5 нужно 3.6 миллиарда). Что-то Anthropic напортачили.

Grok-4.5 очень немногословен и за счёт этого дёшев — немного выгоднее Luna и сильно выгоднее (в 4 раза!), чем GLM-5.2.

Авторы отмечают, что агенты по-разному подходят к решению задач, даже при схожих показателях качества. В Fable 5 (33,8%) и Opus 4.8 (21,1%) используется больше токенов и выполняется меньше действий. В GPT-5.6 Sol (34,4%) и Terra (20,8%) используется меньше токенов и выполняется больше действий. Итого GPT-5.6 Sol примерно на 40% дешевле и использует примерно на 50% меньше токенов, чем Fable 5.

А вот GPT-6 выйдет так вообще... 😇

Читать полностью…

Сиолошная

Как давно высказывалось в канале — неквалифицированные инвесторы не готовы к концепции переноса запуска ракет. Для них переносы хуже аварий, а не наоборот.

Держателям $SPCX приготовиться, это ещё даже взрывов от посадки на воду не было. Отличное казино, свидетели Astra и Virgin Galactic подтвердят.

Читать полностью…

Сиолошная

Началась продажа по $230 за штуку

Видео: https://fixupx.com/OpenAIDevs/status/2077425991790870644?s=20

Покупать тут: https://openai.com/supply/shop/
(я брать не буду, но взял пару футболок)

Читать полностью…

Сиолошная

«Любая достаточно развитая технология неотличима от магии»©

Пользователь Твиттера поручил Claude Fable 5 превратить reMarkable в дневник Тома Риддла из «Гарри Поттера».

То, что написано, стирается, а LLM пишет ответ.

Представьте реакцию людей из поздних 1800-ых, которым бы это показали🤯

(код обещают выложить скоро)

Читать полностью…

Сиолошная

Вышел Sonnet 5 — новая модель по умолчанию для Free и Pro ($20), но доступна всем.

По качеству близко к Opus 4.8, но сильно дешевле: до конца лета будет цена $2/$10, после чего поднимут до $3/$15.

Ну и... в честь релиза сбросили лимиты, так что бегите играться 🤗

Читать полностью…

Сиолошная

Прошло 3 недели и никто не написал про Apple и WWDC, а мне было лень, но что поделать, надо браться. В начале июня компания проводила ежегодную конференцию для разработчиков и вместе с этим рассказала про обновления в AI.

Очень сильно прокачали Siri, теперь она работает на относительно большой (по мобильным меркам) LLM, умеет вызывать инструменты и тесно связана с приложениями и экосистемой. Я видел пару демонстраций в твиттере, где запросы и сценарии показались мне не предусмотренными разработчиками (то есть модель на них не тренировали), и тем не менее Siri справилась отлично. Для тех, кто пользовался LLM, такая генерализация не является чем-то выдающимся, но для обычных пользователей может вызвать ВАУ-эффект. Ого, оно что И ТАК умеет??? Не только по пяти заложенным 15 лет назад сценариям работать?

На девайсах может быть одна из двух моделей — AFM 3 Core (3 миллиарда параметров) и AFM 3 Core Advanced для девайсов помощнее, Phone 17 Pro и выше, iPad с чипом M4 и выше, MacBook с чипами M3 и выше. Такое ограничение потому, что модель действительно «Large» — 20 миллиардов параметров с микстурой экспертов (MoE). Но работает очень хитро — классический MoE работал бы плохо, так как у девайса ограничена пропускная способность между NAND (флеш-память для хранения ваших файлов и весов модели) и DRAM (где хранятся активные параметры для работы). В обычном MoE вы не знаете наперёд, какие именно эксперты вам нужны, поэтому загружаете всю модель, что а) долго б) занимает много памяти, а потом уже экономите на вычислениях, так как работает часть экспертов.

Apple применили трюк, который я вижу впервые: для вашего промпта модель предварительно выбирает набор экспертов на всю модель, а затем загружает только их, и получается от 1 до 4 миллиарда активных параметров. Подход называется Instruction-Following Pruning for Large Language Models и описан в этой статье из начала 2025-го года.

Также эта модель работает и для распознавания вашего голоса (поэтому и оно улучшилось), и для генерации нового голоса Siri (...тоже улучшилось). Вот тут внизу есть пара семплов было/стало, честно говоря старое мне нравится больше 🤷‍♂️

И вторая часть анонса — это удвоение ставки на Private Cloud Compute (PCC), который анонсировали два года назад. Идея в том, что для более сложных запросов, для которых локальной модели (особенно на смартфоне) не хватает, можно отправить промпт и контекст (например, файлы) на зашифрованный сервер, внутрь которого ни у кого нет доступа. Несмотря на то что система имеет открытый код и анализировалась лучшими специалистами по кибербезопасности, надеюсь, что Mythos тоже натравили 😀

Так вот, в PCC тоже обновилась модель, AFM 3 Cloud. Она запущена на серверах Apple и крутится на собственных чипах M-серии. И есть ещё AFM 3 Cloud Pro, которая ещё больше, ещё умнее, развернута на серверах Google на Nvidia GPU. Мне кажется это очень крутой паттерн, с которым мы будем жить: на смартфонах и умных девайсах в ближайшее время не будет настолько мощных чипов, как в серверных стойках, но хочется, чтобы умные модели были доступны.

Все эти модели созданы компанией Apple, это НЕ модели Gemini. Говорят, что Apple усовершенствовала некоторые из этих моделей, дистиллируя Gemini, но все они являются совершенно новыми моделями, в которых используются собственные знания и технологии Apple.

Самое крутое — и на смартфонах, и на макбуках у вас как у разработчика есть доступ к этим LLM. То есть вы можете написать приложение, не обучать свою модель (только сделать промпт) и вызывать её. Это бесплатно для локальной модели, а для облачных бесплатно (!) до какого-то порога, дальше придется платить.

Вот тут и тут можно посмотреть на скорость генерации на разных девайсах — получается даже быстрее, чем я бы ожидал!

Читать полностью…

Сиолошная

https://openai.com/index/previewing-gpt-5-6-sol

👀

Читать полностью…

Сиолошная

Mythos / Fable так и не стали доступны 😭 и на рынках предсказаний вероятности скорого (до конца этого месяца или следующего) перезапуска падают, народ теряет веру.

На фоне этого в твиттере появилось 2 неподтверждённых слуха:
— GPT-5.6 перенесли на середину следующего месяца и не будут выпускать на этой неделе. Но про сам запуск мы ничего не слышали официально.
— Gemini 3.5 Pro тоже перенесли с июня (якобы недовольны результатами), хотя об её анонсе «в следующем месяца» со сцены говорил лично CEO компании.

Как говорится, первые не релизят потому, что боятся блокировки от государства, а вторые боятся, что их не заблокируют 😀

Но на самом деле я не думаю, что GPT-5.6 откладывают по этой причине (если и вправду откладывают). Самая вероятная — торопиться некуда, у конкурентов предложение не поменялось (ведь Mythos / Fable недоступны), можно посидеть доучить и улучшить модель. Все кто хотел уйти к конкурентам уже ушли.

Читать полностью…

Сиолошная

Vals.ai успели протестировать Fable 5 на ProgramBench до отключения. Они заметили странное — несмотря на то, что в 199 задачах из 200 уже на первом ходу система перекинула модель на Opus 4.8 из соображений безопасности, итоговая оценка получилась почти в два раза выше Opus. Более того, модель генерировала в два раза больше токенов и заняло это в два раза больше времени.

Почему так вышло и что именно происходит под капотом — не ясно.

Есть несколько теорий:
— Во время перекидывания на Opus был активен более высокий внутренний режим рассуждений, недоступный извне
— Opus 4.8 незаметно улучшился с момента последнего тестирования.
— Перенаправление идет на каку-то другую внутреннюю версию Opus 4.8.
— Fable всё равно писал первый ответ (и мб писал какой-то крутой план), а только после этого происходила смена на Opus.
— Есть какой-то баг на стороне Anthropic

🤷‍♂️

Метрика на картинке — доля задач, которые «почти решены», то есть для которых проходит 95%+ тестов.

Читать полностью…

Сиолошная

Американское правительство ввело контроль экспорта на... Fable 5 / Mythos 5. На данный момент все страны, кроме США, не имеют права пользоваться моделью; кроме этого, люди без гражданства США не должны пользоваться моделью даже в Штатах.

Это правило применимо даже к сотрудникам Anthropic. Я не знаю, получил ли гражданство условный Andrej Karpathy, но если нет — он не может пользоваться этой моделью даже при работе на работе.

Приказ вступает в силу незамедлительно, компания уже отрубила доступы. (UPD: меня поправили, что на данный момент доступ отключили вообще всем, так как нельзя быстро разобраться, кто гражданин и где он находится)

Ответ Anthropic тут, TLDR:
— причина в том, что появились джейлбрейки, которые обходят систему безопасности Anthropic
— конкретных примеров предоставлено не было
— «Как мы уже публично заявляли, мы считаем, что правительство должно иметь возможность блокировать небезопасные развертывания моделей в рамках установленной законом процедуры, которая является прозрачной, справедливой, ясной и основанной на технических фактах. Данное действие не соответствует этим принципам»

В ближайшие 24 часа Anthropic обещают выпустить более полный ответ, но говорят, что у них на руках есть отчёт, в котором указано, что GPT-5.5 тоже уязвима, но почему-то не забанена.

The real permanent underclass was lack of US citizenship all along...

К другим новостям, появилось видео с GPT-5.6, проходящей тестирование государством, чтобы избежать экспортных ограничений:

Читать полностью…
Subscribe to a channel