data_analysis_ml | Unsorted

Telegram-канал data_analysis_ml - Анализ данных (Data analysis)

48228

Аналитика данных админ - @haarrp @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚

Subscribe to a channel

Анализ данных (Data analysis)

К 2027 году всего 5 компаний — Alphabet, Amazon, Microsoft и Oracle - могут тратить на AI-инфраструктуру около 3.2% ВВП США.

Это выше ожидаемых расходов США на национальную оборону, которые оцениваются примерно в 2.7% ВВП.

Гонка AI уже финансируется в масштабе, который обычно ассоциируется с государствами, войнами, энергетическими системами, железными дорогами, хайвеями и телеком-инфраструктурой.

https://x.com/KobeissiLetter/status/2073777167691845818

Читать полностью…

Анализ данных (Data analysis)

LongCat-2.0 открыли в open source.

Это MoE-модель на 1,6T параметров с примерно 48B активных, заточенная под агентное программирование и длинный контекст до 1M токенов.

По бенчмаркам:
• 59,5 на SWE-bench Pro
• 70,8 на Terminal-Bench 2.1
• 77,3 на SWE-bench Multilingual

Внутри: sparse attention для длинного контекста, ScMoE для экономной активации экспертов и MOPD для разделения задач между агентными, reasoning и interaction-экспертами.

Модель обучали с нуля на 35T+ токенов. Есть поддержка деплоя на GPU и NPU.

🤖https://modelscope.ai/collections/meituan-longcat/LongCat-20

Читать полностью…

Анализ данных (Data analysis)

В AI пришёл surge pricing: DeepSeek повышает цены на API V4 в часы пик в 2 раза.

Новые тарифы будут действовать с 9:00 до 12:00 и с 14:00 до 18:00 по пекинскому времени. Компания объясняет это желанием стабилизировать сервис и лучше распределять ограниченные ресурсы.

Вот так разворот- всего несколько недель назад DeepSeek навсегда снизила цену на V4-Pro на 75%, сделав флагманскую модель заметно дешевле перед запуском динамического ценообразования.

Теперь output для V4 Pro в пиковые часы вырастет с 6 до 12 юаней за 1 млн токенов, около $1.77.

scmp.com/tech/big-tech/article/3358868/after-triggering-price-war-deepseek-reverses-course-surcharge-peak-hour-api-use

Читать полностью…

Анализ данных (Data analysis)

Thinking Machines Миры Мурати превратила закрытую экспертную оценку Bridgewater в обучаемый навык и обошла frontier-модели, снизив число ошибок на 29.8%.

В ии подавали финансовые статьи, отчёты, документы центробанков, письма. ИИ должен был определить что аналитик должен прочитать первым. Для LLM это оказалось тяжёлой задачей. При обычных промптах модели держались на уровне 46–50% accuracy, почти как угадывание.

Экспертные промпты поднимали качество до 74–78%, но лучший результат дала разметка от опытных инвесторов Bridgewater. Неэкспертные метки провалились: здесь важны рыночный контекст, приоритеты и профессиональное чутьё. Один заголовок про тарифы может быть сильным сигналом, другой громкий геополитический инфоповод останется шумом.

Bridgewater чистила датасет через спорные рейсы. Если модель расходилась с разметкой, пример возвращали экспертам на повторную проверку. Так в обучение попали паттерны принятия решений, которые эксперты видят интуитивно, но редко могут описать полноценной инструкцией.

В обучении использовали три приёма. Во-первых, смешивали разные типы задач, чтобы модель училась применять экспертную оценку в похожих сценариях, а не запоминала один узкий шаблон.

Во-вторых, аккуратно ограничивали обновления при обучении. Это снижало риск, что модель зацепится за случайные признаки в данных и начнёт уверенно ошибаться.

В-третьих, модель дообучали на ответах более сильных версий. Так лучшие checkpoints постепенно становились учителями для следующих итераций.

Результат: на 29.8% меньше ошибок, чем у лучшей frontier-модели, и в 13.8 раза ниже inference cost.

Заметное преимущество, благодаря качеству экспертных решений. Такой датасет конкурент не скачает с Hugging Face.

https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/

Читать полностью…

Анализ данных (Data analysis)

В русскоязычном поле не так много авторов, которые разбирают математические расследования международного уровня. Но одно такое местечко всё же есть — это канал Яндекс Образования «Зачем мне эта математика?».

В прошлом году там рассказывали историю о том, как GPT-5 «решил» несколько задач Эрдёша. Тогда оказалось, что модель не создала новое доказательство, а нашла в научной литературе уже существующие решения и правильно связала их с задачами. Это было большим скандалом для OpenAI;

Но история на этом не закончилась. Недавно компания рассказала о другом кейсе: внутренняя reasoning-модель нашла контрпример к гипотезе Эрдёша о единичных расстояниях. Это базовая задача из комбинаторной геометрии.

Долгое время математики ожидали, что лучшие конструкции будут похожи на квадратную сетку. Модель предложила другой подход — с идеями из алгебраической теории чисел. Доказательство затем проверяли независимые математики, а к результату вышел отдельный разбор.

Для тех, кто занимается аналитикой данных и Data Science, это очень важный разбор, потому что здесь виден почти весь стек современного мышления о данных и моделях.

Такие истории хорошо показывают, что математика в AI — это язык, на котором формулируются задачи, ограничения, доказательства, метрики качества и способы проверки.

Больше таких разборов — в канале Яндекс Образования «Зачем мне эта математика?». Там пишут о математике в технологиях, Data Science, ИИ и реальных научных сюжетах. Подписывайтесь!

Читать полностью…

Анализ данных (Data analysis)

Anthropic и Cerebral Valley запускают Built with Claude: Life Sciences

Это онлайн-хакатон для тех, кто хочет собрать AI-продукт вокруг биотеха, медицины и научных исследований.

Anthropic всё активнее двигает Claude в сторону life sciences. Недавно компания представила Claude Science, AI-workbench для исследователей с коннекторами, scientific skills, поддержкой Jupyter/R/HPC и проверяемыми артефактами.

https://cerebralvalley.ai/e/built-with-claude-life-sciences

Читать полностью…

Анализ данных (Data analysis)

Godot фактически запрещает vibe coding в контрибуциях.

Причина простая: PR стало легче генерировать, но не легче проверять. Для open-source движка каждый патч всё равно должен разобрать мейнтейнер, который понимает архитектуру, риски и последствия изменений.

Теперь автономные агенты, крупные AI-сгенерированные куски кода и сгенерированный текст в issues, proposals и PR-дискуссиях запрещены. Разрешены только мелкие помощники вроде автодополнения, regex и find/replace. Помощь AI в коде нужно раскрывать.

На практике правило будет сложно применять: почти невозможно наверняка доказать, где был vibe coding, а где обычная работа разработчика.

Godot защищает не стиль разработки, а время ревьюеров. Код можно сгенерировать за минуты, но ответственность за него всё равно остаётся на людях.

godotengine.org/article/contribution-policy-2026/

Читать полностью…

Анализ данных (Data analysis)

⚡️ Fable 5 снова вернулась в Claude

Модель снова доступна спустя почти три недели после отключения. Ограничения с Anthropic сняли: ранее их вводили из-за формулировки про «угрозу нацбезопасности».

До 7 июля Fable 5 можно использовать в подписках Pro, Team, Max и Premium Enterprise. На неё разрешено тратить до 50% недельных лимитов.

После 7 июля бесплатный доступ закончится, останется только оплата по токенам.

https://claude.ai/

Читать полностью…

Анализ данных (Data analysis)

🔥 Tencent Hunyuan представила PhoneBuddy - агентный фреймворк для управления телефоном на базе Qwen3.5-4B.

Средняя производительность выше, чем у GPT-5.4 и Seed 2.0 Pro, но ниже, чем у Gemini 3.1 Pro.

На бенчмарке из 150 задач результаты выросли так:

SFT: 36.67%
Real-app RL: 40.67%
Hybrid RL: 45.33%

На AndroidWorld рост ещё заметнее:

60.3% → 83.2%

https://arxiv.org/abs/2606.23049

Читать полностью…

Анализ данных (Data analysis)

⚡️ Google открыла Nano Banana 2 Lite и Gemini Omni Flash

Google выкатила два новых инструмента для генеративных медиа: Nano Banana 2 Lite для быстрых изображений и Gemini Omni Flash для видео и conversational editing.

Nano Banana 2 Lite - самая быстрая и дешёвая image-модель в линейке Nano Banana. Она рассчитана на high-throughput пайплайны, прототипирование и массовую генерацию, где важны скорость и цена. Google заявляет около 4 секунд на text-to-image и цену $0.034 за 1K image. При этом модель сохраняет нормальное следование промпту, стабильность персонажей и читаемый текст внутри изображения.

Gemini Omni Flash - модель для генерации и редактирования видео через текст, изображения и видео-референсы. Её можно использовать для natural language video editing, мультимодальных сцен, синхронизации текста с действием и быстрых итераций. Цена заявлена на уровне $0.10 за секунду видео, как у Veo 3.1 Fast.

Сначала Nano Banana 2 Lite быстро генерирует изображение, потом Omni Flash превращает его в видео. Через Interactions API можно сохранять историю сессии и делать до трёх последовательных правок.

Ограничения у Omni Flash пока есть: генерация до 10 секунд, audio references и scene extension в API ещё не поддерживаются, а длинные video references пока обрабатываются неидеально.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

@data_analysis_ml

Читать полностью…

Анализ данных (Data analysis)

Команда LongCat представила LongCat-2.0 - полную модель, которая стоит за Owl Alpha на OpenRouter.

Это MoE-модель на 1.6T параметров, примерно с 48B активных параметров и контекстом до 1M токенов. Основной фокус - agentic coding и длинные задачи, где модели нужно не просто отвечать, а работать с репозиторием, терминалом, поиском и большим объёмом контекста.

В архитектуре есть несколько важных решений. LongCat Sparse Attention отвечает за эффективную работу с 1M-context. Zero-Compute Experts динамически активируют от 33B до 56B параметров на токен, не тратя вычисления на лишние эксперты. MOPD делит экспертизу на три группы: Agent, Reasoning и Interaction, а gate выбирает нужный маршрут под задачу.

По заявленным результатам модель выглядит сильной именно в агентных сценариях: 70.8 на Terminal-Bench 2.1, 59.5 на SWE-bench Pro, 77.3 на SWE-bench Multilingual, 73.2 на FORTE, 78.8 на RWSearch и 79.9 на BrowseComp.

Tech Blog: https://longcat.chat/blog/longcat-2.0/

Читать полностью…

Анализ данных (Data analysis)

🖥 NVIDIA показала HORIZON для agentic hardware design

У NVIDIA вышла работа про HORIZON - систему, где агентное программирование переносится в дизайн железа.

Идея интересная: hardware design рассматривается не как разовая генерация Verilog-кода, а как эволюция целого репозитория. Markdown harness превращается в project pack: внутри доменные знания, исполняемый evaluator, критерий приёмки и правила работы с git.

Дальше агент не просто пишет кусок кода, а меняет изолированное worktree, запускает проверки и двигается по результатам verifier harness.

Для железа это особенно важно. Здесь мало красивого ответа в чате: дизайн должен проходить исполняемые тесты, симуляции и формальные ограничения. Поэтому verifier становится настоящим интерфейсом между агентом и задачей.

В статье заявляют 100% benchmark completion на нескольких наборах задач по hardware design. Даже если вы не работаете с EDA, за этим стоит следить: agentic coding начинает заходить туда, где ошибка стоит намного дороже, чем сломанный unit test.

Paper: https://arxiv.org/abs/2606.28279

Читать полностью…

Анализ данных (Data analysis)

✔️ Fine-tuning больших LLM больше не обязан быть мучительно медленным.

4 open-source библиотеки, которые ускоряют обучение моделей:

1. Unsloth AI
Ускоряет fine-tuning Qwen, Llama, Gemma и других моделей, снижает расход VRAM, подходит даже для consumer GPU и Colab/Kaggle.
https://github.com/unslothai/unsloth

2. LLaMA Factory
Удобный CLI и WebUI для fine-tuning 100+ моделей. Поддерживает LoRA, QLoRA, full/frozen tuning и разные режимы квантования.
https://github.com/hiyouga/LLaMA-Factory

3. DeepSpeed
Фреймворк для масштабного distributed training: ZeRO, FSDP, multi-GPU, multi-node и продвинутая оптимизация памяти.
https://github.com/deepspeedai/DeepSpeed

4. Axolotl
Yaml-based пайплайн для LoRA/QLoRA, DPO, GRPO и multimodal fine-tuning. Хорошо дружит с Hugging Face.
https://github.com/axolotl-ai-cloud/axolotl

Читать полностью…

Анализ данных (Data analysis)

США снова открыли доступ к Claude Mythos 5 от Anthropic для более чем 100 одобренных организаций.

Теперь доступ к Mythos 5 получат более 100 компаний и институтов, включая многие компании из Fortune 500.

«Я определил, что необходимые меры безопасности соблюдены, чтобы разрешить отдельным доверенным партнёрам доступ к модели Claude Mythos 5», - написал министр торговли Говард Латник в пятницу Тому Брауну, chief compute officer Anthropic.

Точный список Annex A не был опубликован.

Ранее публичная founding group Project Glasswing включала AWS, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorgan Chase, Linux Foundation, Microsoft, NVIDIA и Palo Alto Networks.

Но этот публичный список партнёров не является тем же самым, что секретный список Annex A.

Похоже, правительство делает приоритет на институтах, где defensive upside выше, а риск misuse проще контролировать: cloud providers, chip-компании, vendors операционных систем, security-компании, банки, операторы инфраструктуры и федеральные агентства.

https://www.semafor.com/article/06/27/2026/us-releases-powerful-anthropic-model-mythos-to-some-us-companies

Читать полностью…

Анализ данных (Data analysis)

OpenAI показала GPT-5.6 Sol.

Это новый флагман в линейке GPT-5.6. Вместе с ним идут Terra - более сбалансированная модель для повседневной работы, и Luna - быстрый и дешёвый вариант.

Главный фокус Sol: сложные агентные задачи, кодинг, биология и кибербезопасность.

Появляются два важных режима:

• max — больше времени на глубокое рассуждение
• ultra — работа через субагентов для сложных процессов

Пока GPT-5.6 доступен только в ограниченном preview для доверенных партнёров через API и Codex. Более широкий запуск в ChatGPT, Codex и API обещают позже.

https://openai.com/index/previewing-gpt-5-6-sol/

Читать полностью…

Анализ данных (Data analysis)

NVIDIA придумала красивую схему для AI-рынка.

Компания помогает neocloud-провайдерам (облачные компании, которые специализируются на аренде GPU для AI-задач) покупать GPU-инфраструктуру, а взамен получает долю будущей выручки от облачных мощностей.

В итоге NVIDIA зарабатывает дважды: сначала на продаже железа, потом на регулярной доле дохода от аренды этих GPU.

GPU превращается из разовой продажи в долгосрочный денежный поток.

https://blogs.nvidia.com/blog/nvidia-unlocks-ai-compute-at-scale-capital-partners-to-power-ai-infrastructure-buildout/

Читать полностью…

Анализ данных (Data analysis)

CMU показали Gym-Anything: подход, который превращает почти любое ПО в среду для обучения и оценки AI-агентов.

Это важно, потому что реальная работа в приложениях редко похожа на маленькие web-задачи из бенчмарков. В рабочих программах длинные сценарии, грязные состояния, разные интерфейсы, файлы, ошибки установки, странные настройки и много шагов, где агент легко теряется.

Gym-Anything пытается убрать главный bottleneck: ручную сборку таких сред. Один агент сам ставит приложение, пишет скрипты, загружает данные, открывает софт и собирает доказательства, что окружение реально работает. Второй агент проверяет это через скриншоты, логи, файлы и чеклисты. Если setup слабый, он отправляет задачу на исправление.

На этой схеме авторы собрали CUA-World: больше 10 000 задач в 200 приложениях, покрывающих все 22 крупные группы профессий.

Самый адекватный результат: когда задачи становятся похожи на настоящую работу, даже сильные агенты часто проваливаются. Особенно на длинных сценариях, где нужно держать контекст, пользоваться интерфейсом, проверять результат и восстанавливаться после ошибок.

Paper: Gym-Anything: Turn any Software into an Agent Environment
https://arxiv.org/abs/2604.06126

Читать полностью…

Анализ данных (Data analysis)

🚨 Research: Shanghai AI Lab выложила в open source Agents-A1 - 35B MoE agent-модель для long-horizon задач.

Увеличение горизонта работы агента улучшает long-form search, следование инструкциям и научное reasoning.

На отдельных бенчмарках Agents-A1 обходит другие модели класса 35B и приближается к системам с триллионным числом параметров.

arxiv.org/abs/2606.30616

Читать полностью…

Анализ данных (Data analysis)

SciJudge-30B и SciJudge-4B учатся предсказывать, какие научные работы получат более сильное цитирование.

📊 Точность Scientific Judge: SciJudge-30B достигает 80.6 на in-domain задачах и обходит GPT-5.2, GLM-5 и Gemini 3 Pro. SciJudge-4B тоже превосходит гораздо более крупные базовые модели.

🧪 Данные: модель обучалась на сигнале из 2.1 млн arXiv-статей и 696 758 пар предпочтений, сопоставленных по области и времени на основе цитирования.

🧠 Обучение: GRPO с DAPO loss и pairwise-наградами, основанными на цитируемости.

Лицензия: Apache-2.0 🚀

30B 🔬 https://modelscope.ai/models/openmoss/SciJudge-30B-2605
4B 🔬 https://modelscope.ai/models/openmoss/SciJudge-4B-2605
📄 https://modelscope.ai/papers/2603.14473

Читать полностью…

Анализ данных (Data analysis)

Вышел Grug-12B

Это экспериментальный open-source fine-tune на базе Gemma 4 12B IT.

Идея простая - заставить модель «думать» короче, но не терять качество ответа.

Grug обучали на compact-reasoning стиле: меньше воды, меньше лишних шагов, больше плотности в рассуждении.

По заявлению автора, модель генерирует примерно на 69.8% меньше reasoning-токенов и остаётся близко к базовой Gemma 4. На небольшом локальном math-eval она снизила среднее число generated tokens с 228.5 до 68.9.

Главный плюс: быстрее ответы и меньше забитого контекста.

huggingface.co/kai-os/Grug-12B

Читать полностью…

Анализ данных (Data analysis)

💵 GFusion: как мы обучали диффузионную LLM в GigaChat

«А что, если LLM будет генерировать не строго по одному токену слева направо, а сразу блок текста?»


Именно эту идею мы проверяли в проекте GFusion — диффузионной языковой модели на базе GigaChat3-10B-A1.8B-base.

Отдельно хочется отметить, что этот проект начал и довёл до релиза стажер команды GigaChat Pretrain. Он прошёл весь путь от идеи и первых экспериментов до обучения модели, оптимизаций, поддержки в inference runtime и публикации в open source.

Почему это интересно?

Классические LLM генерируют текст авторегрессионно: каждый следующий токен зависит от всех предыдущих. Это устоявшийся подход, но шаги генерации модели выполняются строго последовательно.

В то же время диффузионная LLM берёт частично замаскированный блок и постепенно восстанавливает токены внутри него. За один forward pass модель может финализировать не один, а сразу несколько токенов.

Так и появляется ускорение. Чем больше токенов модель уверенно восстанавливает за один проход, тем меньше шагов ей нужно для генерации ответа.

Вместо дорогостоящего обучения с нуля мы взяли сильную авторегрессионную LLM и перевели её в диффузионный режим генерации.

Цикл обучения включал:
🔘адаптацию AR-модели к диффузионной генерации;
🔘постепенное увеличение размера блока;
🔘сравнение полностью диффузионного обучения и гибридного подхода AR+dLLM;
🔘SFT с complementary masking и стадией confidence tuning для дополнительного ускорения генерации.

Результаты:

🔘GFusion в режиме одного пользователя генерирует в среднем на 70% быстрее GigaChat3-10B-A1.8B.
🔘Даже по сравнению с GigaChat3-10B-A1.8B + MTP-головой ускорение составило около 39%.
🔘Просадка качества относительно авторегрессионной модели осталась в пределах 2–4 п.п., а сам трейд-офф между скоростью и качеством можно контролировать параметрами диффузионной генерации.
🔘Добавлена поддержка GFusion в SGLang и реализован entropy-bounded sampling — алгоритм семплирования, который ускоряет генерацию не только GFusion, но и других диффузионных LLM.
🔘Для обучения написана и выложена в open-source своя реализация attention на TileLang под структуру диффузионной маски и получено до +77% end-to-end ускорения относительно Flex-Attention на длинном контексте.

💡 Главный вывод GFusion состоит в том, что ускорение LLM может требовать переосмысления самого подхода к генерации. Однако, чтобы это заработало на практике, важно довести до рабочего состояния весь стек от обучения и SFT до декодинга, attention-ядер и поддержки в inference runtime.


➡️Подробности — в статье на Habr.
➡️HF: GFusion-10B-A1.8B-base GFusion-10B-A1.8B
➡️GitVerse

Читать полностью…

Анализ данных (Data analysis)

Займи слот ИТ-Пикником от Т-Банка

8 августа — время отложить ноутбуки и встретиться офлайн на ИТ-Пикнике от Т-Банка в музее-заповеднике «Коломенское». Вот сколько всего запланировано:

— научпоп-лекции;
— мастер-классы;
— дискуссии об ИИ и больших языковых моделях;
— доклады о кибербезопасности;
— примеры, как данные из логов становятся решениями;
— много музыки.

Бери с собой друзей, супругов и детей — каждый найдет себе что-то по душе.

Зарегистрироваться и узнать больше можно здесь

Читать полностью…

Анализ данных (Data analysis)

​В продуктах VK появится нейропоиск Discovery AI — новый движок для поиска и рекомендаций на базе собственной LLM.

Технологию внедрят в Дзен, VK Видео и Медиапроекты Mail.

В отличие от привычных ИИ-помощников, этот движок не ищет по всему интернету, а копается только в контентной базе продуктов VK и учитывает интересы пользователя. Система может выдавать ответы быстрее чем за полсекунды и обрабатывать до 3 000 поисковых запросов в секунду.

https://habr.com/ru/companies/vk/articles/1054358/

Читать полностью…

Анализ данных (Data analysis)

⚡Выбирать железо для обучения и инференса моделей больше не нужно

Qwen, Whisper, Deepseek и другие нейросети уже готовы к работе на приватной инфраструктуре. Просто выбираете нужную модель и получаете готовый инференс-сервис в пару кликов в Selectel.

Каталог ИИ-моделей Selectel — удобный инструмент для работы с нейросетями, когда нужны безопасность и производительность.

Что вы получаете в пару кликов:

⚡Большой выбор моделей для ваших задач: для генерации текстов и кода, распознавания речи, создания контента и других.
⚡Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки.
⚡Прогнозируемая стоимость: платите за фактическое время потребления вычислительных ресурсов.

Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/i0hn1

Реклама. АО "Селектел". erid:2W5zFGqCmpM

Читать полностью…

Анализ данных (Data analysis)

Fable 5 может потребовать верификацию личности

* Новые строки из утечки приложения Claude намекают, что Fable 5 могут вынести в отдельную систему usage credits, с оплатой вне обычной подписки.

* В том же обновлении упоминается проверка личности: «Ваши кредиты будут добавлены после подтверждения вашей личности». Это появилось рядом с изменениями по кредитам для Fable 5, хотя Anthropic раньше говорила, что ID-проверки не связаны с Fable.

* Похоже, Fable 5 может выйти с верификацией личности, более строгим доступом и отдельной оплатой по использованию.

Читать полностью…

Анализ данных (Data analysis)

❤️❤️❤️❤️❤️❤️❤️❤️❤️❤️

Как научить ИИ искать информацию, управлять контекстом и автоматизировать сложные процессы?

Ответы на эти вопросы разберут на событии Yandex AI Studio Series Summer Edition, которое стартует 16 июля и продлится до 30 июля.

Событие объединит экспертов Яндекса и специалистов, которые создают современные ИИ-продукты и хотят глубже разобраться в архитектуре агентных систем и возможностях Yandex AI Studio.

Для кого:
— backend- и fullstack-разработчиков;
— ML/ИИ-инженеров;
— продуктовых менеджеров;
— бизнес-аналитиков, интеграторов и ИИ-стартапов.

Присоединяйтесь к Yandex AI Studio Series, чтобы узнать, как применять ИИ-инструменты в реальных задачах, а не только экспериментировать с ними.

Читать полностью…

Анализ данных (Data analysis)

FT: Apple просит Вашингтон разрешить закупку DRAM у CXMT, китайского поставщика из чёрного списка, потому что спрос на AI-серверы сделал обычную память для устройств болезненно дорогой.

DRAM - это краткосрочная рабочая память внутри iPhone, Mac и iPad. HBM - более быстрая многослойная версия памяти для AI-ускорителей. Из-за AI-бума производственные мощности всё сильнее уходят в серверы, а не в потребительские устройства.

Проблема Apple в давлении поставщиков. Компания в основном зависит от Micron, Samsung и SK Hynix, тогда как CXMT могла бы дать более дешёвую поставку из китайской программы развития памяти, поддержанной государством.

Но CXMT находится в списке Chinese Military Company у Пентагона. Сам по себе он не запрещает Apple покупать у компании, но сигнализирует о риске для нацбезопасности. Ситуация станет куда серьёзнее, если Минторг США добавит CXMT в Entity List.

Потеря Apple $263 млрд рыночной стоимости была связана с давлением цен на память, из-за которого пришлось поднимать цены на MacBook и iPad. Это показывает, как спрос на AI-инфраструктуру уже повышает себестоимость обычных потребительских устройств.

https://www.ft.com/content/d72a25e2-7bde-4aa9-bd8d-0c4f3d6cb2cb?syn-25a6b1a6=1

Читать полностью…

Анализ данных (Data analysis)

BrowserBC - новый open-source проект от команды ViDA, который исследует более эффективный способ запускать web agents.

Вместо того чтобы использовать frontier-модель на каждом шаге agent workflow, BrowserBC один раз записывает человеческий web flow с помощью более сильной модели, превращает его в переиспользуемый skill, а затем отдаёт выполнение меньшей и более дешёвой модели.

Результаты выглядят заметно: на WebArena-Hard число tool calls падает на 27%, а success rate растёт с 60% до 81%.

https://github.com/Einsia/Browser-BC

Читать полностью…

Анализ данных (Data analysis)

Anthropic начала возвращать доступ к Claude Mythos 5, но пока не всем.

Компания заявила, что с 12 июня работала с правительством США, чтобы восстановить доступ к Claude Mythos 5 и Fable 5.

Теперь власти разрешили снова развернуть Mythos 5 для части американских организаций, которые занимаются эксплуатацией и защитой критической инфраструктуры.

Anthropic называет Mythos 5 своей самой сильной моделью для кибербезопасности.

То есть доступ возвращают не глобально, а сначала тем структурам, которые работают с инфраструктурой, безопасностью и защитой систем.

Параллельно компания продолжает переговоры с правительством, чтобы расширить доступ к Mythos 5 и снова сделать Fable 5 доступной для общего использования.

Ситуация хорошо показывает новый режим для frontier-моделей: релиз уже зависит не только от самой лаборатории, но и от согласований с государством.

https://x.com/AnthropicAI/status/2070665903440871779

Читать полностью…

Анализ данных (Data analysis)

Это очень сильный отчёт - The State of the AI Economy от Exponential View.

Главная идея: AI-экономика уже стала реальным рынком, а не только хайпом вокруг инфраструктуры.

Ключевые цифры:

• $110 млрд реальной AI-выручки за последние 12 месяцев после удаления двойного счёта. То есть если $1 потратили на Claude, он считается один раз, даже если часть денег потом ушла Amazon или другому инфраструктурному провайдеру.

• $175 млрд - текущий annualized run rate. Это показывает резкое ускорение рынка. Считаются расходы конечных клиентов, а не деньги, которые просто проходят по цепочке поставщиков.

В расчёт не включали Китай, внутреннюю экономию компаний от AI, рост рекламы, консалтинг и системную интеграцию.

Темпы роста примерно в 3 раза быстрее, чем у мобильного интернета и обычного интернета на ранних этапах.

Скорость формирования выручки резко выросла: новый $1 млрд AI-выручки теперь появляется меньше чем за 2 дня. В 2023 году на это уходило около 180 дней.

Enterprise AI уже вышел за рамки пилотов, но глубокое внедрение на уровне всей компании всё ещё только начинается.

Упоминания AI появились в отчётных звонках у 31% отслеживаемых компаний из S&P 500.

Но только 20% компаний дали конкретные численные оценки влияния AI на бизнес.

Интересный момент по инфраструктуре: AI-выручка hyperscalers пока примерно покрывает амортизацию AI-инфраструктуры.

Но экономика GPU сильно зависит от предположения, что вычислительное оборудование будет использоваться около 6 лет. Для другой AI-инфраструктуры срок моделируют примерно на 14 лет.

Снижение цен на токены не обязательно снижает выручку.

Каждое снижение цены токенов на 10% приводит к росту использования токенов примерно на 12-18%.

Это значит, что спрос на AI выглядит эластичным по цене: чем дешевле становится AI, тем быстрее растёт использование.

Главные ограничения для будущего масштабирования - доступность электроэнергии и стоимость дата-центров.

intelligence.exponentialview.co

Читать полностью…
Subscribe to a channel