Библиотека data scientist’а

@dsproglibПроверенLive API

Полезные материалы по всему, что может быть интересно дата сайентисту.

Обратная связь: @proglibrary_feedback_bot
По вопросам рекламы: @proglib_adv_bot
Медиа-кит: https://prglb.ru/1vvzm

КатегорияOtherЯзыкRUДобавлен06 июл. 2026 г.КачествоПроверен
Открыть в Telegram
Подписчики8.7K
Сред. просмотры115.2K
ERR12.2%
Цена-- RUB
Цена / подписчик--
Цена / просмотр--
Метрики обновлены: 06 июл. 2026 г.
Последние посты
5 агентных воркфлоу которые автоматизируют DS-пайплайн Вот пять паттернов которые реально используются прямо сейчас. 🔍 1. Агент для EDA и очистки данных LLM-агент анализирует датасет, находит пропуски и аномалии, генерирует и выполняет код для очистки. Инструменты: DataInterpreter , DatawiseAgent . ⚙️ 2. Агент для feature engineering CAAFE и похожие системы автоматически генерируют новые признаки через LLM, тестируют их на кросс-валидации и оставляют только полезные. 🤖 3. AutoML-агент с самопланированием AutoKaggle и LightAutoDS-Tab разбивают ML-пайплайн на фазы (понимание данных → выбор модели → настройка → отчёт) и управляют ими через специализированных агентов. 🔄 4. Агент мониторинга и drift detection После деплоя агент следит за дистрибуцией входных данных и метриками модели. При обнаружении drift — автоматически запускает переобучение или эскалирует к человеку. Встроено в системы типа BDaaS с LLM-оркестрацией. 📊 5. Агент для генерации инсайтов из графиков LLM с vision интерпретирует визуализации, контекстуализирует тренды и генерирует текстовые инсайты 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #свежак
5066 июл.
🔥 Открытое занятие по AgentOps — курс стартовал! Сегодня в 19:00 по МСК пройдет первое занятие нового потока, на которое может прийти каждый. Оцените пользу нашего подхода на ретрансляции урока в VK! 👨‍💻 Спикер: Андрей Носов Тема: Архитектура управления: state machine для AI-агентов Будем разбираться, как использовать State machine в качестве главного оружия против стохастики (непредсказуемости) LLM. Что в программе: ● State machine: инварианты и терминальные состояния; ● Паттерны маршрутизации: Supervisor, ReAct, Plan-and-Solve; ● Детекция циклов и настройка аварийных выходов; ● Абстракция от модели: как сделать каркас, который переживет смену LLM/провайдера; ● Адаптация графов под ограничения локальных моделей; ● Версионирование графов и миграции стейта. Результат занятия: Вы поймете, как спроектировать надежный каркас агента с жестким контролем исполнения и переходов. 👉 Подписывайтесь на нашу группу ВКонтакте , чтобы не пропустить старт трансляции!
6536 июл.
⚡️ mixle: библиотека для composable вероятностных моделей Идея простая: любая модель — это дистрибуция. Gaussian, Transformer LM, смесь, HMM — всё одинаковый интерфейс. Собираете из них что нужно, вызываете fit() — инференс выбирается автоматически. Автовыбор модели одной командой: m = mixle.propose(data, fit=True) m.evaluate(...) m.sample(5) m.explain() m.deploy("artifacts/m") Библиотека сама перебирает кандидатов, ранжирует на held-out данных и возвращает победителя. Дальше — чейн методов на одном объекте. Distillation учителя в маленькую локальную модель: student = distill(teacher, train, n=4, dim=512, hidden=[64], epochs=250) gated = CalibratedTaskModel(student, alpha=0.1).calibrate(cal, teacher(cal)) cascade = Cascade(gated, teacher, cost=CostModel(c_local=0.0, c_frontier=0.01)) cascade.serve(stream) # ~92% запросов обрабатывается локально cascade.report() # -> ~8% эскалировано; ~$2.76 сэкономлено / 300 запросов Дорогой teacher (LLM, API, правило) отвечает только на сложные случаи. Масштабирование одним аргументом: optimize(..., backend="spark") # или dask, ray, mpi optimize(..., engine=TorchEngine(device="cuda")) Та же логика инференса — локально на NumPy или распределённо на кластере. 📦 Что внутри — ~90 дистрибуций: скалярные, многомерные, structured (HMM, LDA, PCFG, смеси) — PPL-диалект: Normal(free, free).fit(data) — estimate mean + std в одну строку — Enumeration: ранжирование поддержки дискретных моделей в порядке убывания вероятности — MLOps: артефакты, drift detection, versioned registry pip install mixle pip install "mixle[all]" # + GPU, Spark, Dask, коннекторы к данным Ссылка на библиотеку 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #свежак
7835 июл.
👍 Miles : open-source фреймворк для large-scale LLM RL post-training RL post-training больших моделей — это уже не просто цикл обучения. Это распределённая система где rollout workers генерируют сэмплы, trainer их потребляет, политики должны оставаться синхронизированными, а MoE-модели добавляют свою специфику роутинга. Miles решает именно эту задачу. Четыре компонента склеены в одну систему: — SGLang — high-throughput rollout generation — Megatron-LM — scalable distributed training — Ray — оркестрация, жизненный цикл акторов, fault tolerance — PyTorch — модели, autograd, mixed precision, профилировка Rollout memory-bandwidth-bound, training compute-bound — эти две фазы принципиально разные, и Miles обрабатывает границу между ними явно. ✨ Поддержка из коробки: DeepSeek-V4, Kimi K2.5/K2.6, GLM-5/5.1, Qwen3.5/3.6. NVIDIA Hopper и Blackwell. Ссылка на библиотеку 📍 Навигация: Вакансии • Задачи • Собесы Библиотека дата-сайентиста #свежак
8494 июл.
🎬 Как ИИ ускоряет разработку и где ломаются архитектуры Мы провели открытый вебинар, где разобрали реальные боли проектирования автономных систем. Ольга Лукьянова на практическом кейсе показала, как использовать ИИ-ассистентов для реальных задач. Вы просили запись встречи — она уже в открытом доступе! Что внутри: — Как с помощью ИИ быстрее разбираться в незнакомом коде и готовить пулл-реквесты; — Критерии выбора между одним агентом и мультиагентной системой; — Разбор популярных архитектурных ошибок и ограничений современных ИИ; — Практические рекомендации по проектированию и внедрению облачных агентов. 👉 Посмотреть полную запись можно тут: ● VK ● YouTube 🚀 Хотите пойти дальше открытого вебинара? Если вы готовы перейти от простых промптов к проектированию надежных, отказоустойчивых ИИ-систем, которые не сливают бюджет компании на API, приходите на курс AgentOps. Поток уже стартовал, но двери еще приоткрыты! 👉 Успеть на курс AgentOps
8424 июл.