avatar
Клуб CDO
@cdo_club
23.08.2026 21:46
Дайджест статей

📰 Стоковый ClickHouse занял 12 ГБ диска при 543 КБ данных
🔗 https://habr.com/ru/articles/1070270/
💡 Вывод: 98.8% вставок в базу оказались собственной телеметрией ClickHouse (trace_log, asynchronous_metric_log, text_log - без TTL из коробки), мерж-амплификация 1:678. Проверяйте, какая доля I/O вашего стораджа обслуживает полезную нагрузку, а какая - самонаблюдение движка. Второй урок автора дороже первого: настройка, пропорциональная ресурсам машины, не имеет права лежать в дефолтном конфиге. Универсальны оказались только три из одиннадцати.

📰 The dark side of компрессия в PostgreSQL
🔗 https://habr.com/ru/companies/tantor/articles/1071746/
💡 Вывод: коэффициент сжатия - ложная цель. Реальные метрики - write и read amplification. Страницы переменного размера дают максимальное сжатие ценой WAF 1.5-2x, страницы фиксированного размера 4 КБ дают WAF вдвое лучше несжатой записи. На больших объёмах LZ4 обгоняет несжатый вариант даже когда данные уже в кэше ОС, а zstd проигрывает 69% на распаковке при лучшем коэффициенте. Выбирайте размер страницы по проценту overflow, а не по среднему размеру. Оговорка: статья от вендора Tantor Labs, тесты на их же CSM.

📰 Как я улучшил векторный поиск в YDB
🔗 https://habr.com/ru/articles/1072032/
💡 Вывод: +28% throughput и p99 66→53 мс получены без единого изменения алгоритма поиска, recall остался 0.883. Цепочку из нескольких стадий StreamLookup заменили одним read-актором. Показательный кейс: когда логика размазана по независимым стадиям, ей негде держать состояние, а без состояния невозможны ни кэш уровней, ни best-first обход, ни ранний выход. Автор прямо говорит, что 28% были побочным эффектом, целью было создать место для оптимизаций.

📰 Как ИИ меняет работу с корпоративными данными - итоги седьмого митапа MWS
🔗 https://habr.com/ru/companies/ru_mts/articles/1072154/
💡 Вывод: самый плотный материал в выборке. Data Governance 2.0 = классический DG + Model Governance + управление рисками + управление стоимостью, где каждый ИИ-кейс описан формальным манифестом (источники, разрешённые и запрещённые действия агента, условия остановки, место человека в контуре). Качество меряют по цепочке, а не по финальному ответу: hit rate, precision, citation rate - это позволяет отделить ошибку модели от дыры в поиске. Стоимость запроса считают с retrieval, embeddings, хранением и временем человека на проверку. Отдельно про Text2SQL: масштабируется не количество примеров, а онтология и YAML-манифест метаслоя, 90% на пилотных доменах при рубле за описание поля.

📰 Теория и практика DWH: все виды SCD по Кимбаллу
🔗 https://habr.com/ru/articles/1073420/
💡 Вывод: справочник, а не аналитика. Полезен тем, что раскладывает SCD 0-7 на одной шкале сложности и явно отделяет базовые типы (0-4) от гибридных (5-7), которые в проде почти не встречаются. Годится как быстрая опора при проектировании измерений или как материал для онбординга.

📰 Обзор технологий S3-хранилища
🔗 https://habr.com/ru/companies/vk/articles/1071120/
💡 Вывод: обзорная статья с одной практической мыслью - защита от шифровальщиков живёт не в бэкап-стратегии сверху, а внутри хранилища. Object Lock переводит объекты в WORM на заданный срок и блокирует удаление даже администратором, версионирование само по себе от компрометации ключей не спасает. Дедупликация даёт около 20% экономии на архивах и логах. Оговорка: материал VK Tech, заканчивается рекламой их Object Storage.
👍 5
24 846

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Клуб CDO

4.1K
Сообщество профессионалов в области работы с данными, искуственным интеллектом и разработкой сложных ИТ систем.

Поделиться контентом: @shaman_sw
Поддержка канала и сообщества:
Открыть в Telegram