RTD: Ссылки и репосты 5082

🎁 *Notion Data Analyst Roadmap* : https://www.notion.so/templates/data-analyst-roadmap
👉 *Support & Subscribe to Channel* : http://bit.ly/3GiCVUE

☕ *Stay Connected*
► Subscribe: http://bit.ly/3GiCVUE
► LinkedIn: https://www.linkedin.com/in/baraa-khatib…

148 views06:23

RTD: Ссылки и репосты

https://youtu.be/pe-5Hh3fVVY?si=ILn4x9RkyzgDzn1v

YouTube

How to get ahead of 99% of Data Analysts

🧠 Free course:
Data Storytelling: https://mindspeaking.com/datastorytelling

📙 Check out my book:
People Skills for Analytical Thinkers: https://mindspeaking.com/book

🔗 Connect with me:
Website: https://www.mindspeaking.com/
Linkedin: https://linkedin.c…

144 views20:12

RTD: Ссылки и репосты

Forwarded from 🔋 Труба данных (Simon Osipov)

https://dbtips.substack.com/p/the-core-principles-of-robust-data

Казалось бы, очень простые советы, но каждый раз смотря на очередной DWH, я удивляюсь тому, какую мешанину там напридумывали, что это очень тяжело поддерживать.

@ohmydataengineer - канал "🕯Труба Данных"

Please open Telegram to view this post

VIEW IN TELEGRAM

Substack

The Core Principles of Robust Data Modeling (Part 1)

How to build scalable and reusable analytical models

136 views08:48

RTD: Ссылки и репосты

Forwarded from Через тернии к Визам

1:19

Media is too big

VIEW IN TELEGRAM

How to. Make Chat in DataLens
Немного шутливый пост, что внутри DataLens можно сделать чатик =)
ага, как в в конце девяностых в браузерах =)

На самом деле полезная штука для определенных задач. Это интеграция через API с Базой данных и запись / чтение из нее информации. Это может быть write-back, триггер обновления данных или смена статуса заказа (привет, CRM)

143 views08:50

RTD: Ссылки и репосты

Forwarded from Делаю BI

Всем привет= )

У нас в Core BI Авито открылась новая ставка и мы ищем крутого спеца senior - lead уровня, который и ~~швец и жнец и всем пиз~~ и в датавиз и в инженерию и в построение BI процессов.
Цель амбициозная - строить вместе с нами крутую BI функцию во всем Авито с достаточно низкого старта.
Непосредственно тимлидом буду я, команда работает в прямом подчинении head of bi (@alexbarakov)
Задачи на любой вкус:
1) Можно заниматься построением высокоуровнего репортинга для всего Авито или C-level пользователей
2) Можно писать много SQL и выстраивать архитектуру витрин
3) Можно лидировать проекты развития всей фукнции BI (как пример: продумать и внедрить процессы сертификации отчетности, разработать концепцию и внедрить аналитические рабочие места для разных ролей не-аналитиков, разработать стандары репортинга BI)
Пропорции этих типов задач будут примерно 30/20/50

Автономность - высокая, свобода выбора интересных проектов - еще выше. Комьюнити BI ламповое и вовлеченное.

Опыт работы в кор командах BI или выстраивании BI процессов - весомый плюс. Опыт участия в таких проектах - желателен и почти обязателен

За подробностями - велкам в лс @astigo

179 views10:58

RTD: Ссылки и репосты

https://www.parse.bot/

www.parse.bot

Parse - Data from Anywhere

A platform that can allow you to get data from anywhere

👍1

495 views19:16

RTD: Ссылки и репосты

Forwarded from Лаборатория данных (Таня Мисютина)

В советах добралась до самой увлекательной, на мой взгляд, части. Разбираю конструирование каркасов и визуализаций в подходе алгоритма Δλ.

https://bureau.ru/soviet/20250806/

Бюро Горбунова

Конструируем каркасы. Часть 1

В следующих заметках я покажу, как комбинируя способы упорядочивания объектов на осях из предыдущего совета, сконструировать самые полезные и часто используемые форматы визуализации — столбиковую диаграмму, линейный график, хитмап, график разброса и карту.…

183 views10:10

RTD: Ссылки и репосты

Forwarded from Дашбордец

Котятки🐱,
Сегодня при подготовке к одному из демо, ко мне попал занятный материал про кросс-культурные особенности в анализе и датавизе, делюсь:
https://datacalculus.com/en/knowledge-hub/data-analytics/data-visualization/cross-cultural-considerations-in-visualization
Про цвета, направление текстов и время я обычно помню, а вот всякие культурно-когнитивные особенности я часто забываю))

DataCalculus

Cross-Cultural Considerations in Data Visualization

Learn essential cross-cultural considerations in data visualization to improve clarity and engagement in global audiences.

178 views11:44

RTD: Ссылки и репосты

https://www.metricinsights.com/

Metricinsights

Metric Insights - Keeping your users engaged with governed BI

Metric Insights’ Enterprise BI Portal is the leading BI governance platform that integrates all your BI tools, reporting, and metrics into a single, consolidated catalog of governed and certified assets. Metric Insights drives engagement with BI making it…

173 views12:29

RTD: Ссылки и репосты

Forwarded from Data Secrets

Нашли тут для вас готовый ноутбук для файнтюна gpt-oss

Внутри все end-to-end, от скачивания модели и подготовки данных до обучения и инференса.

Еще и мощно оптимизировано, кстати. Моделька на 20В вмещается в 14GB видеопамяти. То есть теоретически запустится даже на бесплатных ресурсах колаба.

Ноутбук для 20В (его же можно использовать для 120В)

А вот тут лежат все текстовые пояснения к коду и «теория»:про то, как работает формат Harmony и почему он необходим, например. В общем все, чтобы запускать код не в слепую (хотя так тоже можно), а с достаточно глубоким пониманием.

Занятие на выходные что надо

170 views20:09

RTD: Ссылки и репосты

Forwarded from настенька и графики

Ко мне неделю назад пришел Chris Dalla Riva и пишет такой: "я тут книжку написал, в ней есть графики, не хочешь посмотреть и написать про это?". А я конечно же хочу, когда еще и внижку дают посмотреть))

Chris супер дата аналитик и музыкант, проекты у него тоже музыкальные. Не помню, как я его нашла, но работы его очень люблю -- каждый пост полноценный анализ, например, когда умер рок-н-ролл? У него еще были коллабы с the pudding: 500 величайших альбомов всех времен или про женщин копмозиторов.

🎧 В итоге, Chris написал книгу Uncharted Territory с анализом музыкальных хитов, я повытаскивала оттуда графики и собрала в формате советов, что у него интересного можно подсмотреть:
- дизайн аннотаций
- графки в чб
- джанк чарты и многое еще внутри

160 views15:46

RTD: Ссылки и репосты

Forwarded from Data Memes

😁2

145 views06:54

RTD: Ссылки и репосты

Forwarded from Yandex DataLens

6:20

Media is too big

VIEW IN TELEGRAM

⚡️ Параметризация источника в датасете

Встречайте функциональность, выводящую работу с вашими датасетами на новый уровень!

Параметризация позволит:
- Подменять таблицу в запросах
- Передавать в SQL, определяющий датасет, параметр как часть запроса

Смотрите видео и читайте подробности в документации!

👍1

169 views08:03

RTD: Ссылки и репосты

Forwarded from Через тернии к Визам

1:40

Media is too big

VIEW IN TELEGRAM

Небольшие приятные фичи за прошлый месяц.

Мой фаворит - ввод из буфера значений в параметр =)

А как вам в целом лучше было бы узнавать о новых фичах в BI-продукте?
- Попапами в продукте?
- Текстовыми анонсами в канале / чатике?
- Видосиками?

143 views08:54

RTD: Ссылки и репосты

Forwarded from Refat Talks: Tech & AI

0:28

This media is not supported in your browser

VIEW IN TELEGRAM

🤩 Как новенький LangExtract от Google может помочь в AI работе с доками, RAG и не только

Неделю назад Google тихо выпустил библиотеку, которая решает боль production LLM систем: как гарантировать, что извлеченные данные действительно есть в источнике, а не выдуманы моделью. Ты задаешь примеры что хочешь извлечь из текста (например, даты и суммы из контракта), LangExtract находит все такие элементы и показывает где именно каждый находится в документе, гарантируя что ничего не выдумано. Мне как раз надо было что-то подобное, я полез изучать, потом залез в исходники и залип.

Ключевая инновация - Source Grounding
Каждое извлечение привязано к точным координатам в тексте. Парсите контракт на 50 страниц? Система не просто скажет "срок оплаты 30 дней", но и покажет exact char positions где это написано. Под капотом - умный fuzzy matching алгоритм, который находит источник даже если LLM слегка перефразировал. То есть да, это как NER только без обучения, и как structured outputs, но с точным и надежным определением координат цитаты.

А еще на основе моих тестов эта штука поразительно хорошо и быстро работает с длинными документами.

Ботанский кусок (разверните кому интересно):

Покопался в исходниках, рассказываю суть.

По сути LangExtract = Few-shot Information Extraction + Structured Outputs + Automatic Source Grounding.

В отличие от простого использования structured outputs, автоматически находит точное местоположение типа {"startpos": 41, "endpos": 57}.

Общий принцип:

Документ → [Chunking] → [LLM + Schema] → [alignment phase] → Результат с позициями

Трехуровневый alignment (exact → case-insensitive → fuzzy) покрывает все основные кейсы, результаты потом валидируются.

Поддерживает extraction_passes - это механизм множественных независимых проходов извлечения по документу для повышения recall (полноты). LLM могут "пропускать" некоторые сущности при первом проходе, особенно в длинных текстах, поэтому повторные проходы помогают найти больше информации.

На входе использует example-driven подход - вместо написания промптов вы предоставляете несколько примеров того, что хотите извлечь. Из этих примеров автоматически генерируется JSON schema для structured output и создается few-shot промпт. Поддержка разных LLM провайдеров (Gemini, OpenAI, Ollama) с оптимизациями под каждый.

А с длинными доками хорошо работает за счет трех элегантных решений:
- Intelligent chunking с сохранением границ предложений (не тупое разбиение по токенам)
- Multi-pass extraction - несколько независимых проходов, каждый может найти что-то новое, результаты консолидируются
- Массивная параллелизация - десятки чанков обрабатываются одновременно

Есть встроенная HTML-визуализация с подсветкой найденных элементов прямо в исходном тексте (показана на видео).

Некоторые альтернативы: Instructor/Marvin/Outlines.

Use кейсы для вдохновления:
- Контракты на 100+ страниц - находит все суммы и сроки с точной ссылкой на цитату, можно легко интегрировать в UI "подсветку" фактов
- Медкарты с записями - извлекаем дозировки лекарств с гарантией и визуальным указанием источника
- Data Science стал еще доступнее: на вход тысячи не структурированный документов, на выход - CSV с нужными колонками и точными координатами откуда взял
- Извлекаете из корпоративной wiki, email, Slack: люди, проекты, технологии, их связи. Строим графы знаний - Profit!

Главное: LangExtract не просто надежно извлекает, но еще и доказывает откуда взял каждый факт.
Двигаемся еще ближе от "LLM как магический черный ящик" к "LLM как надежный production инструмент".

Блогпост | Репа

🔥➕🔁

124 views12:08

RTD: Ссылки и репосты

https://habr.com/ru/companies/sberbank/articles/937242/

Хабр

Продвинутые техники RAG в действии

Всем привет! Представьте таблицу с сотнями или даже тысячами атрибутов. Как в условиях высокой размерности найти релевантные данные по запросу на естественном языке?...

137 views07:52

RTD: Ссылки и репосты

Forwarded from Data Secrets

0:29

This media is not supported in your browser

VIEW IN TELEGRAM

Мы как-то пропустили, но оказывается Hugging Face недавно тихо выпустили так называемые AI sheets

Это ни много ни мало мечта ML-инженера: инструмент позволяет интерактивно и очень быстро создавать и размечать датасеты почти под любую задачу.

Для этого надо просто выбрать доступную открытую модель (а вообще проект опенсорс, так что можно и закрытую, и свою собственную прикрутить при желании), задать текстовый промпт и получить готовый датасет. Затем его можно еще и отредактировать.

Ну и, конечно, можно загружать уже готовые датасеты, расширять их или менять. С мультимодальностью все тоже работает.

Легко запускается локально, инструкция лежит у них на гите.

github.com/huggingface/aisheets

👍1

149 views11:08

RTD: Ссылки и репосты

Forwarded from [29/100] Витя Тарнавский

Где искать кейсы по GenAI

Кейс-библиотеки у OpenAI и других вендоров абсолютно ужасны. Типичный кейс – это расплывчатая задача, ноль техдеталей и восхваление соответствующего вендора. Можете сами посмотреть: OpenAI, AWS, Google.

Классные кейс-библиотеки
– Evidently AI - удобная табличка-агрегатор с 652 кейсами с ссылками
– GenAI & LLM System Design - мощная библиотека кейсов с тех деталями на базе Evidently AI, расширенная и выложенная на гитхаб
– ZenML LLMOps Database - 800+ кейсов от разных компаний, собранных ZenML
– LangChain Case Studies - вендорская небольшая библиотека кейсов про LangChain: хорошие, с подробностями

Не кейсошные, но тоже классно
– Awesome LLM Apps - куча простых LLM-приложений с кодом
– Deloitte AI Dossier / PDF - хороший список GenAI идей. Если хотите открыть новый бизнес в GenAI – есть где вдохновиться

Российские
– Yandex Cloud: неплохая библиотека кейсов от Яндекса, есть детали. Нет фильтра по YandexGPT – фильтруем глазами
– Generation AI: хорошая небольшая кейсошная от JustAI
– Gigachat Cases: довольно слабая кейсошная от Сбера

Кидайте в комментах что ещё знаете!

162 views07:26

2025/10/21 09:42:31
Back to Top

HTML Embed Code:

<iframe width="100%" src="https://www.bootg.com/buyppe/web?embed=1" title="Telegram Web" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowfullscreen></iframe>