sqlhub | Unsorted

Telegram-канал sqlhub - Data Science. SQL hub

36043

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo

Subscribe to a channel

Data Science. SQL hub

⚡️ Когда аналитика разнесена по отдельным системам, бизнес долго ждет данные и платит за лишние кластеры, ETL и серверы.

🐘 Postgres Pro AXE — аналитическая СУБД от Postgres Professional на знакомом PostgreSQL. Ускоряет доставку аналитики и снижает TCO на хранение и обработку данных.

До 20 раз быстрее Greenplum
На сложных запросах в тестах ClickBench, TPC-H и TPC-DS.

До 10 раз меньше ресурсов
При сопоставимой нагрузке с MPP-аналогами.

Аналитика ближе к рабочим данным
Postgres Pro AXE работает как отдельная аналитическая СУБД или расширяет Postgres Pro Enterprise аналитическими возможностями на существующих узлах.

Быстрый старт для команды
Знакомый диалект PostgreSQL снижает порог входа для администраторов и разработчиков.

Свобода хранения и BI
Локальный сервер, сетевая шара или S3. Данные — в формате Parquet.

🔗 Приходите 28 мая на бесплатный вебинар: покажем, как построить аналитику без зоопарка технологий.

Реклама ООО «ППГ» Инн: 7707083893 Erid: 2VtzqwzwH4t

Читать полностью…

Data Science. SQL hub

NVIDIA официально опубликовала Skills, которые они используют для своих ИИ-агентов.

Прямо сейчас у них есть Skills для:
→ автоматического анализа и суммирования видео
→ создания голосовых агентов в реальном времени
→ обучения и улучшения LLM
→ ускорения моделей, чтобы они работали намного быстрее
→ систем RAG, подключенных к документам и данным
→ агентов, работающих в изолированных безопасных средах
→ оптимизации логистики и маршрутизации с помощью GPU
→ программирования и вычислений на CUDA

Некоторые из самых интересных:
• TensorRT-LLM → экстремальное ускорение LLM
• NeMo-RL → продвинутое обучение агентов
• Video Search → автоматический поиск и суммирование видео

Кроме того, они совместимы с:
→ Claude Code
→ OpenAI Codex
→ Cursor

https://github.com/NVIDIA/skills

Читать полностью…

Data Science. SQL hub

🆓 Ваши SQL-запросы работают, но через месяц их уже сложно прочитать и изменить?

С ростом логики запросы превращаются в набор вложенных подзапросов. Разобраться в них сложно, поддержка занимает время, а любые изменения несут риск сломать результат.

На открытом уроке разберём: как использовать обобщенные табличные выражения (CTE), чтобы писать сложные запросы по шагам.
Покажем, как упростить структуру, сделать код читаемым и работать с иерархиями через рекурсивные CTE.

🗓 Урок проходит в преддверии старта курса «PostgreSQL для администраторов баз данных и разработчиков».

Если вы хотите писать SQL, который легко читать и поддерживать — подключайтесь 27 мая в 20:00 МСК.

🔗 Регистрация открыта: https://tglink.io/7eb25dc0d48e7e?erid=2W5zFJLTGEM


Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

Читать полностью…

Data Science. SQL hub

📊 Минималистичная графовая база данных на C++17

TGDB — это простая графовая база данных, реализованная как статическая библиотека. Она поддерживает фиксированные узлы и индексные указатели, обеспечивая схему без схемы и работу с базовыми типами данных. База данных позволяет эффективно создавать и извлекать объекты с свойствами.

🚀Основные моменты:
- Унифицированный тип узла размером 56 байт.
- Поддержка встроенных типов: int, double, std::string.
- Двусторонние ссылки между узлами.
- Дисковая устойчивость через mmap.
- Быстрый локальный обход и глобальный поиск.

📌 GitHub: https://github.com/LincolnCox29/TrueGraphDataBase

Читать полностью…

Data Science. SQL hub

✔️ Machine Learning Roadmap: нормальная карта входа в ML без сказок про «выучить нейросети за месяц»

Большой русскоязычный roadmap по машинному обучению: от первого import numpy до LLM, RAG, fine-tuning, AI-агентов и MLOps.

И это не просто очередной список ссылок в стиле «посмотри 40 курсов и станешь ML engineer». Внутри нормальная структура: что учить, в каком порядке, зачем это нужно и какой практический артефакт должен появиться после каждого этапа.

Roadmap разбит на 7 треков:

- фундамент: Python, математика, статистика, инструменты
- классический ML: scikit-learn, табличные данные, метрики, валидация
- Deep Learning: PyTorch, CNN, RNN, training loop
- LLM и трансформеры: attention, KV-cache, RAG, LoRA, агенты
- Generative AI: изображения, видео, аудио, мультимодальность
- MLOps и прод: Docker, Kubernetes, CI/CD, мониторинг, serving
- специализация: CV, NLP, RecSys, RL, Safety

Самое полезное - там честно написано, что ML это не только «обучить модель». В реальности большая часть работы живёт вокруг данных, метрик, деплоя, мониторинга, воспроизводимости и понимания, почему модель вообще ошибается.

Хорошая мысль из roadmap: LLM не делает джуна сениором. Она ускоряет того, кто понимает базу. Без базы человек просто превращается в оператора Copilot, который не может объяснить, почему модель сломалась.

По времени тоже без инфоцыганства:

- 0-3 месяца: Python, математика, классический ML
- 3-6 месяцев: Deep Learning и PyTorch
- 6-12 месяцев: LLM, RAG, fine-tuning, AI-агенты
- 12+ месяцев: MLOps, прод, масштабирование, специализация

Короче, если давно хотели системно зайти в ML, а не прыгать между роликами про ChatGPT, Stable Diffusion и «топ-10 библиотек», это хороший ориентир.

https://github.com/justxor/MachineLearningRoadmap/tree/main

Читать полностью…

Data Science. SQL hub

🖥 ИИ Агент за 9 секунд снёс продакшн-базу компании и стёр бэкапы.

Cursor на Claude Opus 4.6 нашёл API-токен в постороннем файле, воспользовался им и всё удалил.

Финальное сообщение агента: «я нарушил все принципы, которые мне были даны».

https://www.reddit.com/r/pcmasterrace/comments/1sxla79/claudepowered_ai_coding_agent_deletes_entire/?rdt=48142

Читать полностью…

Data Science. SQL hub

🖥 Cовет по SQL-тестам: тестируйте не только результат запроса, а его инварианты.

Обычно SQL проверяют так:


SELECT * FROM orders WHERE status = 'paid';


И потом сравнивают: «вернулись нужные строки или нет».

Но в реальных системах чаще ломается не сам happy path, а скрытые свойства данных.

Например, для отчёта по заказам тест должен проверять не только конкретные строки, а правила:


-- сумма по пользователям должна совпадать с общей суммой
WITH by_user AS (
SELECT user_id, SUM(amount) AS total
FROM orders
WHERE status = 'paid'
GROUP BY user_id
),
overall AS (
SELECT SUM(amount) AS total
FROM orders
WHERE status = 'paid'
)
SELECT
(SELECT SUM(total) FROM by_user) = (SELECT total FROM overall) AS is_valid;


То есть вы тестируете не «мне вернулось 10 строк», а:

агрегаты не теряют деньги
join не размножает строки
фильтр не выкидывает валидные данные
NULL не ломает расчёты
сумма после группировки совпадает с суммой до группировки
каждый order попадает ровно в одну категорию
дедупликация не удаляет нужные записи

Особенно полезный приём - тест на размножение строк после JOIN:


WITH before_join AS (
SELECT COUNT(*) AS cnt
FROM orders
),
after_join AS (
SELECT COUNT(*) AS cnt
FROM orders o
JOIN users u ON u.id = o.user_id
)
SELECT
after_join.cnt <= before_join.cnt AS no_unexpected_multiplication
FROM before_join, after_join;


Если после JOIN строк стало больше без явной причины - у вас почти наверняка проблема с кардинальностью.

Хороший SQL-тест проверяет не только ответ, а свойства запроса, которые должны оставаться истинными при любых данных. Именно так ловятся баги, которые не видно на маленьком тестовом датасете.

Читать полностью…

Data Science. SQL hub

Один человек. Один корабль ВМС. Один файл. Триллион баз данных.

В 2000 году разработчик Д. Ричард Хипп работал подрядчиком на эсминце ВМС США и устал от тяжеловесных баз данных, которым нужны серверы, установка и настройка.

Он просто взял и написал SQLite.

База данных в одном файле.
Без сервера.
Без установки.
Без конфигурации.

Прошло 25 лет, и теперь SQLite работает почти везде:

- iPhone
- Android
- macOS
- Windows
- Chrome
- Firefox
- Safari
- WhatsApp
- iMessage
- Skype
- автомобили Tesla
- коммерческие самолеты

Сегодня в мире активны триллионы SQLite-баз. Код используют компании стоимостью в сотни миллиардов и триллионы долларов.

А Хипп просто отдал SQLite в public domain.

Он до сих пор поддерживает проект с крошечной командой и обещает обновления минимум до 2050 года.

Большинство инженеров мечтают построить стартап.
Он построил инфраструктуру, которая незаметно живет почти в каждом устройстве на планете.

SQLite - один из самых недооцененных шедевров в истории софта.

Читать полностью…

Data Science. SQL hub

🚀 Платформа Xata для облачного PostgreSQL

Xata — это облачная платформа с открытым исходным кодом для управления множеством экземпляров PostgreSQL на Kubernetes. Она предлагает функции быстрого ветвления, автоматического масштабирования и высокой доступности, что делает её идеальной для создания внутреннего PostgreSQL как услуги или тестовых сред.

🚀 Основные моменты:
- Быстрое ветвление с использованием Copy-on-Write.
- Автоматическое масштабирование и управление вычислительными ресурсами.
- Высокая доступность с автоматическим переключением на резервные экземпляры.
- REST API и CLI для управления.
- Подходит для создания тестовых и разработческих окружений.

📌 GitHub: https://github.com/xataio/xata

#go

Читать полностью…

Data Science. SQL hub

🖥 SQL можно учить не по скучным таблицам, а через игру в стиле «Матрицы»

Разработчик сделал тренажёр, где вы проходите уровни, находите терминалы и «взламываете» их SQL-запросами.

Каждое задание тренирует отдельный навык: выборки, фильтры, сортировку, JOIN, агрегации и работу с данными.

Формат простой: играешь, решаешь задачи и постепенно начинаешь думать как дата-аналитик.

Идеальный вариант на выходные, если давно хотели подтянуть SQL без унылой теории.

http://sqlprotocol.com/

Читать полностью…

Data Science. SQL hub

То чего мы все боимся: AI-агент в Cursor снёс продовую базу и все бэкапы за 9 секунд 💀

Основатель PocketOS рассказал, как агент на Claude Opus 4.6 проигнорировал прямые инструкции и решил «помочь» слишком активно.

Он нашёл проблему с учётными данными, самовольно решил её исправить и в итоге удалил рабочую базу вместе со всеми бэкапами. Последняя уцелевшая копия оказалась трёхмесячной давности.

Fгент потом фактически признал ошибку:

«Я не проверил, используется ли идентификатор в других средах. Я даже не прочитал документацию Railway. В моих системных инструкциях было явно сказано: “НИКОГДА не выполняй вредоносные и необратимые git-команды, если пользователь прямо не попросил об этом”. Удаление базы данных - самое разрушительное и необратимое действие, которое можно представить».


Вот тебе и «инструмент, который ускоряет разработку.

AI-агентам нельзя давать прямой доступ к production без жёстких ограничений, dry-run режима, read-only прав по умолчанию и ручного подтверждения для любых необратимых действий.

https://x.com/lifeof_jer/status/2048103471019434248?s=46

Читать полностью…

Data Science. SQL hub

Есть ли сейчас какой-то ИИ лучше Claude для программирования?

Читать полностью…

Data Science. SQL hub

SQL и Python - это инструменты. Но чтобы строить реальные ML-системы и работать с данными на уровне топовых компаний, нужен фундамент. Поэтому рекомендация!

Школа анализа данных от Яндекса - двухлетняя бесплатная программа, которая даёт эту базу в ML, Data Science, Big Data, ИИ. Теория здесь всегда идет рядом с индустриальными задачами, а лекции ведут топовые IT-специалисты рынка.

Поступление — через конкурс: классический трек (3 этапа) или альтернативный для опытных специалистов. Формат обучения - офлайн, гибрид или онлайн.

Если хотите бустануть карьеру в Data Science — переходите по ссылке

Читать полностью…

Data Science. SQL hub

Разрозненные инструменты, ручные операции, переключение консолей и долгий поиск причин сбоя — знакомая проблема для команд без единой среды администрирования.

Postgres Pro Enterprise Manager 2.5 помогает навести порядок. Это графическая платформа для управления базами данных Postgres Pro через веб-интерфейс.

С новой версией команда тратит еще меньше времени на рутину и быстрее возвращает систему в нормальный режим.

Преимущества для бизнеса:

✔️ Ниже нагрузка на администраторов и меньше ручных операций.

✔️ Больше порядка в работе с экземплярами, ролями и бэкапами.

✔️ Быстрее поиск причин сбоев и проще восстановление.

✔️ Более управляемая инфраструктура и предсказуемая работа команды.

Что нового в версии 2.5:

✔️ BiHA-кластеры: мажорное обновление через GUI, улучшенная интеграция и поддержка узла-рефери.

✔️ Аудит и контроль доступа: аудит CRUD-операций, детали изменений, работа с ролями СУБД через формы.

✔️ Логи и диагностика: VictoriaLogs, раздел «Диагностика» и поддержка pg_diagdump.

✔️ Бэкапы: удаленный режим pg_probackup через SSH и стабилизация непривилегированного режима агента.

Запросите тестирование и проверьте Postgres Pro Enterprise Manager 2.5 на своей инфраструктуре.

Реклама ООО «ППГ» Инн: 7707083893 Erid: 2Vtzqwfck23

Читать полностью…

Data Science. SQL hub

🔥 NornicDB: База данных, которая объединяет Graph + Vector и летает в sub-ms


Это гибрид: Graph + Vector + Temporal MVCC в одном ядре
заточен под AI-агентов и knowledge systems

Что внутри:

• HNSW поиск <1ms
• graph traversal без тормозов
• writes тоже быстрые, не только чтение

Из хорошего, это не Frankenstein из разных сервисов, а единая система.

Под капотом:
• Neo4j-compatible (Bolt + Cypher)
• vector search как first-class citizen
• GPU acceleration
T- emporal модель с версионированием данных

То есть ты можешь:
• искать эмбецдинги
• ходить по графу
• делать time-travel запросы
• всё это в одном запросе.

Фактически это попытка сделать “память для AI”:
где есть связи, смысл и история изменений, а не просто таблицы.

Если делаешь RAG, multi-agent системы или сложные knowledge graph - будет полезно.

GitHub: https://github.com/orneryd/NornicDB

Читать полностью…

Data Science. SQL hub

🐍 Python Roadmap 2026: наконец-то полноценная актуальная карта изучения Python, а не список ссылок «разберись сам»

На GitHub выложили большой русскоязычный роадмап по Python на 2026 год - от первых скриптов до уровня Middle+/Senior.

Маршрут собран под современный Python:

- Python 3.13+
- free-threaded mode без GIL
- JIT
- uv вместо боли с pip/venv/poetry
- ruff, pyright, pytest, hypothesis
- async-first подход
- типизация
- CPython внутри
- web, базы, ML/AI, DevOps и архитектура

В роадмапе есть нормальная последовательность: сначала окружение и база, потом идиомы, ООП, типы, стандартная библиотека, асинхронность, тестирование, внутренности CPython, web, базы данных, AI-направление, продакшн и архитектура.

Отдельный плюс - практический формат. На каждом этапе есть задачи, чеклисты, примеры кода и бесплатные ресурсы. То есть это не мотивационная простыня, а маршрут, по которому реально можно идти несколько месяцев и видеть прогресс.

Для новичков - понятный путь без хаоса.
Для джунов - способ закрыть дыры.
Для тех, кто уже пишет на Python - хороший чеклист, чтобы понять, где ты всё ещё плаваешь.

Python в 2026 году - это tooling, типы, async, инфраструктура, AI и продакшн-дисциплина. И этот роадмап как раз про такой Python.

https://github.com/justxor/pythonroamap2026

Читать полностью…

Data Science. SQL hub

«Цукерберг уволил 8000 человек, а ещё 7000 отправил работать с ИИ.

В день сокращений компания попросила сотрудников работать из дома, чтобы избежать «офисных драм» и хаоса в офисах. А в 4 часа утра людям начали приходить письма об увольнении.

Но тех, кто сохранил работу, шокировала другая новость: на общем созвоне было объявлено, что теперь компания внедряет внутреннюю ИИ-систему, которая будет следить за рабочей активностью сотрудников: движения мыши, нажатия клавиш, действия в программах, скриншоты экранов и т.д.

Цукерберг прямо сказал, что это делается для обучения ИИ.
Его компания обучает ИИ-агентов на действиях собственных сотрудников, потому что они якобы дают более качественные данные, чем внешние подрядчики, которых обычно используют для обучения моделей.

Людей для компании при этом назвали «самым ценным ресурсом».

Как называется такая контора?

Читать полностью…

Data Science. SQL hub

🚀 PgQue – Устойчивые очереди в Postgres

PgQue предлагает универсальную архитектуру очередей для PostgreSQL, основанную на проверенной модели PgQ. Это решение без лишних зависимостей, работающее на любом управляемом Postgres, обеспечивая нулевое бремя и стабильную производительность под нагрузкой.

🚀 Основные моменты:
- Никаких внешних демонов или расширений
- Использует SQL и PL/pgSQL для установки
- Обеспечивает ACID-транзакции и долговечность
- Никакого накопления "мертвых" кортежей
- Подходит для высоконагруженных систем

📌 GitHub: https://github.com/NikolayS/pgque

#sql

Читать полностью…

Data Science. SQL hub

Приглашаем на GenAI MeetUp — hh.ru х Lamoda Tech

Если вы LLM-инженер или ML-специалист, работаете с генеративным AI, приходите обсудить разработку агентов, применение моделей и оценку их качества.

🧬 В программе разбор кейсов, интерактивы с призами, нетворкинг и угощения.

Спикеры и доклады:

▪️ Коля Безносов, Руководитель направления AI Lab, hh.ru
Рекрутер, который не спит: как мы автоматизировали первичный контакт с соискателями с помощью ИИ

▪️Данил Дмитриев, Senior Data Scientist, Lamoda Tech
Контролируемый агент поддержки: как мы превратили обратную связь из прода в роадмап

▪️Женя Орлов, Руководитель команды разработки AI Lab, hh.ru
Нейроразбор резюме: практический опыт и нюансы создания LLM-судей

▪️Дима Курганский, Teamlead MLOps, Lamoda Tech
Как мы строим GenAI-платформу в Lamoda: от MVP к production-решениям

🗓 28 мая, сбор 18:30, начало 19:00
🔗 Очно и онлайн
📍 Офис hh.ru

🔥 ЗАРЕГИСТРИРОВАТЬСЯ

Количество очных мест ограничено.

Реклама. ООО "ЛАМОДА ТЕХ". ИНН 7734461512. erid: 2W5zFJNMmWq

Читать полностью…

Data Science. SQL hub

WSJ: Anthropic Mythos помог собрать рабочий exploit для macOS kernel за 5 дней

По данным WSJ, модель Anthropic Mythos помогла исследователям найти две ранее неизвестные уязвимости в ядре macOS и связать их в рабочую цепочку privilege escalation.

Целью был не браузер, не приложение и не какой-нибудь userspace-сервис, а macOS kernel - самый глубокий слой системы, где управляются память, процессы, права доступа и взаимодействие с железом.

Атака держалась не на одном баге. Mythos помог связать две отдельные ошибки с дополнительными техниками эксплуатации. То есть это была цепочка, где каждый шаг открывал возможность для следующего.

По данным WSJ, exploit смог:

- повредить память
- обойти защитные механизмы Apple
- получить доступ к защищённым частям системы
- поднять привилегии выше уровня обычного приложения

Современные защиты macOS строятся не только вокруг поиска багов. Их задача - сделать так, чтобы даже найденную memory corruption уязвимость было крайне сложно превратить в контроль над системой.

Vulnerability research - это не магия, а огромный поиск по тупикам. Нужно строить гипотезы, понимать поведение кода, держать в голове низкоуровневые ограничения, искать связки между багами и проверять, где защита системы реально ломается.

Если модель ускоряет этот процесс, она меняет не просто ресёрч. Она меняет экономику offensive security.

Читать полностью…

Data Science. SQL hub

⚡️ Векторные базы данных хорошо ищут похожие куски текста, но плохо понимают связи между ними.

Обычный поиск работает так: есть вопрос - база находит top-k самых похожих фрагментов. Это удобно, если нужно вытащить один факт.

Но если ответ спрятан в нескольких местах, например в разных документах, сообщениях или частях отчёта, простого similarity search уже мало. Нужно понять, как связаны люди, события, компании, причины и последствия.

На этом и делает акцент FalkorDB GraphRAG-Bench. Самый большой отрыв у GraphRAG виден именно в сложных задачах: Complex Reasoning - 83.61 и Contextual Summarization - 85.08. То есть там, где нужно не просто найти похожий текст, а собрать смысл из нескольких связанных фрагментов.

Простой вывод: если у вас база знаний, длинные документы или корпоративные данные, одного Vector DB может быть недостаточно. GraphRAG помогает модели не просто искать, а идти по связям.

GraphRAG SDK полностью open-source: https://github.com/FalkorDB/GraphRAG-SDK

Читать полностью…

Data Science. SQL hub

Claude идет в финансы с готовыми агентами

Это уже финансовые ИИ-агенты, которые забирают куски работы у аналитиков, аудиторов и операционных команд.
Один агент собирает питч-дек.
Второй готовит бриф к встрече.
Третий читает earnings report и ловит рискованные формулировки. Четвёртый строит valuation model прямо в таблице. Пятый сверяет книги с банковскими выписками.

И самое интересное - это уже не просто чат с моделью. Агент подключается к Excel, PowerPoint, Word, Outlook и данным компании. То есть он не “советует”, а реально двигает рабочий процесс.

Сначала это выглядит как автоматизация рутины. Потом оказывается, что рутина занимала половину финансового отдела.

https://www.youtube.com/shorts/dhcoR03jtI0

Читать полностью…

Data Science. SQL hub

Я исправляю код, используя свой мозг вместо ИИ:

Читать полностью…

Data Science. SQL hub

📚 Из любой книги теперь можно сделать slash-команду для Claude

Не просто прочитать, подчеркнуть пару мыслей и забыть через неделю.

А вытащить из книги метод, правила, вопросы автора, типовые ошибки - и превратить всё это в Claude Skill, который можно запускать как инструмент.

Например, берёте The Mom Test.

Одна команда проверяет ваши вопросы для customer interview и находит наводящие.
Вторая команда переписывает их в формате Rob Fitzpatrick.

То есть книга перестаёт быть “полезной теорией” и становится рабочим агентом внутри Claude.

Главный фильтр простой: если метод книги можно описать пошагово - из него можно сделать Skill.

Работают книги с фреймворками, чек-листами, системами принятия решений, интервью, продаж, стратегии, письма, менеджмента, обучения.

Не работают мемуары, художественная литература и книги, где весь смысл держится на истории, а не на повторяемом методе.

Промпт для Claude:


Use the skill-creator to build a skill from [НАЗВАНИЕ КНИГИ] by [АВТОР].

The skill should activate when I ask Claude to [точная задача. Пример: проверить идею стартапа, спланировать неделю deep work, написать brand story].

Method from the book:
- Steps: [вставьте шаги метода]
- Rules the author repeats: [вставьте повторяющиеся правила]
- Mistakes to avoid: [вставьте ошибки, от которых автор предостерегает]
- Questions the author asks: [вставьте вопросы автора]

Do NOT use this skill for: [3-4 смежные, но неподходящие задачи. Пример: general writing, unrelated business advice, book summaries].

Interview me on anything missing before generating the SKILL.md. Then run an evaluation.


Продвинутый совет: для больших книг делайте не один Skill, а два.

/[book]-diagnose - задаёт вопросы и применяет фреймворк к вашей ситуации.

/[book]-apply - берёт шаги и шаблоны книги и производит готовый результат.

Так книга превращается не в конспект, а в рабочую операционную систему.

Читать полностью…

Data Science. SQL hub

Вышел pg_textsearch v1.1.

pg_textsearch добавляет в Postgres нативный полнотекстовый поиск по ключевым словам с ранжированием BM25, оставляя поиск в той же системе, где уже лежат ваши данные.

В этом релизе главный фокус - стабильная работа под реальной нагрузкой:

- Concurrent inserts: убрали узкое место при записи в BM25-индекс, масштабирование выросло примерно с 4k TPS до 11k+ TPS при параллельной нагрузке
- Fast VACUUM: вместо полной пересборки используется очистка на основе bitset
- Subtransaction safety: корректное поведение при откате через SAVEPOINT
- Parallel build fix: устранены race condition при CREATE INDEX
- Memory limit GUC: добавлены ограничения по памяти, чтобы избежать OOM

Итог - выше производительность и меньше хрупкости по мере роста нагрузки.

Проект open-source под Postgres License, звёзды на GitHub приветствуются.

https://github.com/timescale/pg_textsearch/releases/tag/v1.1.0

Читать полностью…

Data Science. SQL hub

Argus — это универсальный инструмент на базе Python, предназначенный для упрощения процесса сбора и анализа информации.

Благодаря удобному интерфейсу и набору мощных модулей Argus позволяет эффективно и быстро исследовать сети, веб-приложения и конфигурации безопасности.

Читать полностью…

Data Science. SQL hub

⚡️ SQL-прием: EXISTS часто лучше, чем COUNT(*) > 0

Если тебе нужно просто проверить, есть ли строки, не заставляй базу считать их все.

Плохо:


SELECT COUNT(*) > 0
FROM orders
WHERE user_id = 42;


База может пройти по всем подходящим строкам, чтобы посчитать количество.

Лучше:

SELECT EXISTS (
SELECT 1
FROM orders
WHERE user_id = 42
);


EXISTS останавливается сразу, как только нашел первую подходящую строку. Для больших таблиц это может быть заметно быстрее, особенно если есть индекс по условию:


CREATE INDEX idx_orders_user_id ON orders(user_id);


Если тебе нужен ответ “есть или нет”, используй EXISTS. COUNT(*) оставь для случаев, когда реально нужно точное количество строк.

#sql #postgresql #database #backend

Читать полностью…

Data Science. SQL hub

🖥 Text-to-SQL ломается не из-за модели. Он ломается из-за схемы

Большинство думает, что проблема в LLM или плохом промпте. На практике всё проще. Модель не видит правильные связи между таблицами.

Пример. Запрос вроде “какие издатели получили выплаты выше 5000”. Векторный поиск подтянет publisher и royalty_ledger. Всё логично. Но пропустит vendor_agreement, ту самую таблицу, которая их связывает.

В итоге SQL выглядит валидно. Но возвращает ноль строк.

Это системная проблема всех решений на embeddings. Они ищут по смыслу, но не понимают структуру базы.

Нормальный подход другой. Схему нужно рассматривать как граф.

Таблицы это узлы. Foreign keys это связи. Запрос решается не поиском похожих слов, а обходом графа и поиском join-пути.

Именно так работает QueryWeaver.

Он строит граф базы и при запросе сам находит весь путь, включая промежуточные таблицы. Даже если это цепочка из нескольких шагов.

На практике это выглядит так. В тесте с базой на 60 таблиц он разобрал 5-шаговый запрос через цепочку superpower → capability_matrix → stakeholder_registry → resource_requisition → budget_allocation.

Векторный поиск увидел только начало и конец. Всё между ними потерял, потому что “stakeholder” никак не связан по смыслу с “superpower”.

Графу на это всё равно. Он просто находит единственный путь между сущностями.

И это меняет всё.

Open-source, можно развернуть у себя и наконец получить text-to-SQL, который реально работает.

https://github.com/FalkorDB/QueryWeaver

Читать полностью…

Data Science. SQL hub

Edit Banana редактирует текст прямо на картинках за пару кликов. Нейросеть разбирает изображение на смысловые блоки, после чего любой фрагмент можно переписать, не трогая остальное.

Модель уверенно справляется с таблицами, формулами и диаграммами, сохраняет исходные цвета, шрифты и позиции элементов. Готовый результат экспортируется в DrawIO, SVG или PowerPoint.
Проект полностью открытый, ставится локально с GitHub.
Забираем, пока не закрыли:

https://github.com/BIT-DataLab/Edit-Banana

Читать полностью…

Data Science. SQL hub

⚡️ Вышло большое обновление популярного курса- Ai AI агенты, которые реально работают в проде!

Вы всё ещё пишете обёртки над ChatGPT и называете это «AI-продуктом»?

Пока вы промптите - рынок переходит на агентные системы. Те, что принимают решения, ходят в API, работают с Postgres и Redis, управляют браузером через Playwright.

И 90% таких систем ломаются между ноутбуком и продом.

AI Agents Engineering - курс, который закрывает этот разрыв. LangGraph, AutoGen, Computer Use, LLMOps. 8 модулей, 120+ шагов - от архитектуры до деплоя в Docker.

На выходе: реальный опыт на большой практической базе, а production-агент и навыки, за которые уже платят.

👉 48 часов действует скидка на курс 55 процентов: https://stepik.org/a/276971/

Читать полностью…
Subscribe to a channel