Летняя школа системного блока
Что такое
журналистика данных
Идеи проектов
Большие и открытые данные
10 секретов хорошего материала
Ссылка на этот сайт
Мария Казакова

Работа: дата-журналистка. Отвечаю за аналитическое направление в управлении внешних связей Центра организации дорожного движения Москвы (ЦОДД) с 2021 года.

Преподаватель Института медиа НИУ ВШЭ и Высшей школы урбанистики им. Высоковского.

Сфера ответственности:


Другие профессиональные интересы:

Бакалавриат: Международная журналистика, МГИМО, 2015–2019.
Магистратура: Журналистика данных, ВШЭ, 2019–2021.
Мария Казакова
лектор
Контакты
Телеграм: @oilunem
Телефон: +7-926-170-40-93
Почта: marikasakowa@gmail.com
Смело пишите по любому вопросу
Алгоритм
  1. Идея + Данные​
  2. Очистка и обработка данных
  3. Анализ
  4. Внешняя валидация гипотез: ищем доказательства вне данных (эксперты, медиа и т.д.), что наши выводы разумны и возможны
  5. Визуализация
  6. Текст
  7. Вёрстка и публикация
Данные (data) — представление информации в формализованном виде, пригодном для передачи, интерпретации и обработки людьми или компьютерами.

Информационная иерархия:
Сигнал → Данные → Информация → Знание → Понимание



Данные — формализованный сигнал.
Информация — полученное в ходе обработки и анализа данных, понятное человеку сообщение; данные с содержательным контекстом.
Знание — осмысленная информация, позволяющая сформировать представление о предмете. Мы обладаем знанием, когда знаем, как поступить с информацией.
Понимание — возможность увидеть логическую взаимосвязь в полученном знании и применить её для понимания окружающего мира. Когда мы учитываем возможности и границы применимости знания, мы переходим на уровень понимания.
Мудрость — знание и понимание пускаются в дело: благодаря полученным инсайтам, мы решаем, как поступить лучшим образом.
Идея + Данные
  1. От идеи к данным.
​Сначала возникает идея, например:
«Я хочу написать историю о том, сколько люди зарабатывают. Может, посмотреть, как изменились доходы людей за последние 5 лет? Доходы выросли или упали?»​

А затем ищем подходящий источник данных

2. От данных к идее.
Сначала мы находим интересный датасет — например, сколько в среднем зарабатывают люди в разных регионах России.

А затем, тщательно изучая данные, мы находим инсайты и идею для статьи, например:
«Где живут самые богатые россияне: в Москве, Магадане или Мурманске?»

Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
3. Стратегия супа: соединение разных тем.​​

Тема 1: Фольклор​
Тема 2: ДТП

Статья: «Зловещие перекрёстки: почему в местах, где, согласно фольклору, ведьмы проводят обряд инициации, ДТП случаются чаще всего?»

🌻 ВАЖНО! Не стоит приступать к работе над статьёй, пока вы не убедитесь, что нужные вам данные существуют. Неважно, большие данные или малые: их должно быть достаточно.
Форматы
  • xlsx — табличный формат документов для Microsoft Excel
  • csv/ tsv — Comma-Separated Values/ Tab-Separated Values — текстовый файл, где данные разделены запятыми, табуляцией или другими символами
  • web table — таблицы из интернета, например, из Википедии (см. Нобелевские премии по году вручения)
  • pdf таблица — таблицы в пдф-файлах

Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
  • xml — Εxtensible Μarkup Language — данные древовидной структуры, содержат угловые скобки
  • json — JavaScript Object Notation — древовидная структура с парами ключ–значение и фигурными скобками
  • geojson — то же самое, что и json, но с геокоординатами
  • неструктурированные данные — всё, что нуждается в предобработке перед анализом
Можно просмотреть любой файл с помощью Блокнота.

🌻 ВАЖНО! Готовая инфографика (картинки с какими-то числами или графиками) — это НЕ данные!
Большие и открытые ❤️
Большие данные — 7 Vs:
  • Volume — Объём — большой размер​.
  • Variety — Разнообразие — различные типы и природа данных.
  • Velocity — Скорость — данные автоматически генерируются и обрабатываются с высокой скоростью.
  • Veracity — Достоверность — надёжность источника данных и их ценности.
  • Value — Ценность — эти данные стоит анализировать, они не бесполезны.
  • Variability — Изменяемость — связь данных и описываемой ими реальности непостоянна, так как сама реальность непостоянна. Одни и те же предметы могут по-разному записываться в данных, и наоборот: одна и та же запись может описывать разные предметы.
  • Visualisation — Визуализация — ключевые инсайты можно отразить на изображении.



Ответ: вагадане — золотодобыча, рыбная ловля, энергетика.
Открытые данные — общедоступные машиночитаемые данные, которые все могут скачивать и изучать.

Ваши данные — селф-трекинг, изучение собственных данных — см. Quantified Self​ (+ r/QuantifiedSelf) —например:
  • доходы и расходы;​
  • число шагов в день.
Проекты-примеры:
Возможен ли показатель, который в разных ситуациях может быть
и качественным, и количественным?
Да
Очистка данных
Очистка и обработка данных — второй шаг на пути подготовки дата-материала.

После того, как мы нашли данные, нам нужно их обработать и подготовить для дальнейшего анализа — только так мы сможем успешно применять формулы и реструктурировать полученную таблицу.

Цель этого этапа — структуризация и унификация форматов и содержания.



Типы данных:
  • int — integer — целые числа
  • float / real — дроби, числа с долями
  • str — string — текст
  • date — дата
  • time — время
  • Boolean — True/False; ИСТИНА / ЛОЖЬ — Булево значение, логический тип данных, да или нет
  • Null / None — нет данных или нет результата действия;
  • в питоне None влияет на расчёты как самостоятельный тип данных, а не как просто пропуск и пустое место
Анализ данных
После того, как вы собрали и очистили данные, настало время третьего этапа — анализа данных.

Хотя это может звучать сложно и зловеще, на деле многие проекты реализуются на основе базового статистического анализа и простейших математических операций.

Основные правила написания формул в Excel вы можете увидеть в соседней колонке →.

В питоне всё не так!
  • равно в условиях ==
  • не равно != или is not
  • и — & либо and
  • или — | либо or



Общие положения по работе в Excel:
  • формулы начинаем вводить со знака =
  • для закрытия ячейки жмём Enter
  • чтобы протянуть формулу, тянем за пимпку в правом нижнем углу или дважды кликаем по ней
  • чтобы закрепить диапазон, добавляем доллары перед буквой и цифрой в начале и конце диапазона: $A$1:$D$12
  • равно =​
  • меньше <
  • больше >
  • не равно <>
  • не такой-то формат =....(..)=ЛОЖЬ​​ — формулы ЕТЕКСТ, ЕЧИСЛО, ЕПУСТО и т.д.​
  • число без кавычек 2023
  • текст в кавычках "2023"
  • условие «и» — это формула (условие_1;условие_2)
  • условие «или» — это формула =ИЛИ(условие_1;условие_2)
  • число в скобках () считывается экселем как отрицательное значение, то есть (60) = -60
Визуализация данных
Это один из последних шагов при работе над дата-журналистской статьёй. Перед этим шагом вы должны быть готовы ответить хотя бы на эти вопросы:

1. Какие параметры вы хотите визуализировать?
2. Ради чего? Какова цель? (например, сравнить два тренда или подчеркнуть 5 лидирующих значений и т.д.)
3. Какова ключевая идея вашей визуализации, что читатель должен понять, увидев ваш график?

Используйте визуализации, когда они помогают следовать принципу:
"A picture is worth a thousand words"





В отличие от визуализаций технических профессий, где важно следование ГОСТам и прочим стандартам, в визуализациях для медиа нужно блюсти чистоту, опрятность и понятность.

Статистик Эдвард Тафти среди ключевых принципов визуализации назвал Ink-Data Ratio, согласно которому чем меньше «чернил» использовано в визуализации, тем лучше.

Узнать больше:
Дата-журналистская статья
После того, как вы завершили все предыдущие этапы работы над статьёй, можно, наконец, собрать всё воедино. Например, на Tilda.

Проекты на Tilda можно самостоятельно добавить в выдачу гугл-поиска с помощью Google Search Console.
Структура статьи
Это примерная структура статьи, которую можно (но необязательно) использовать для подготовки дата-журналистского лонгрида.

Основной блок должен быть разделён на подразделы (секции, смысловые блоки) с подзаголовками
  • Введение
    • Заходная картинка
    • Заголовок
    • Подзаголовок
    • Ваши имена
    • Дата публикации​
  • Лид
    Один параграф: о чём мы расскажем читателям в этой статье?

    Лид должен визуально отличаться от основного текста.
  • Основной текст
    1. Описание проблемы и общего контекста: что происходит сейчас?

    2. Бэкграунд (в плане структуры этот параграф может быть где угодно): как было раньше?

    3. Графики, созданных по всем правилам визуализации. Каждый из них должен сопровождаться:
    • абзацем-подводкой: почему этот график вообще появляется? к чему он?
    • кратким текстовым описанием ключевого визуального элемента: куда мы должны смотреть? какая точка на графике самая важная? почему
    • анализом и интерпретацией графика + дополнительной информацией из внешних источников: почему так получается? что мы знаем об этом?
    ​4. Цитата, визуально отличающаяся от основного текста:
    • фото спикера
    • имя, должность, страна спикера
    • внутритекстовая ссылка на первоисточник цитаты
    • текст цитаты
  • Выводы
    1. Подзаголовок, например, «Выводы» или «Что мы узнали» и т.д.

    2. Ключевые выводы вашей статьи (сухо суммируем то, что уже упоминалось выше в основном тексте статьи): что вы обнаружили в ходе анализа? почему это важно?

    3. Takeaway message: какую главную идею должен запомнить читатель из вашей статьи? какой в ней самый интересный момент, о котором он будет рассказывать друзьям спустя месяцы и годы после прочтения?

Описание графиков
Примеры из статьи "Severe drought threatens honey bees in Chile" by Christine Chan and Dave Sherwood, Reuters Graphics, 2019
Слова вместо цифр

50 % — половина

30–35 % — треть

25 % — каждый четвёртый

25/100 : 5 = 5/20 : 5 = 1/4

20 % — каждый пятый

10 % — один из десяти, каждый десятый


В английском:
  • one in ten — доля
  • one out of ten — всего 10 (максимум), один из 10
Ключевые термины
Дата-журналистика — жанр журналистики, где данные становятся инфоповодом, иллюстрацией или инструментом для создания журналистского материала.

Дата-аналитика — анализ данных с целью получить прикладные выводы.

Дата-визуализация — визуальное агрегированное представление данных.







Данные — пообъектные значения (для каждого объекта перечислены его характеристики).

Статистика — агрегированные по определённому принципу показатели. Методология формирования показателей не всегда прозрачна.

Инфографика — визуальное представление выводов анализа данных, неотъемлемо содержащее интерпретацию создателя инфографики.
Возможные форматы подачи дата-материала
  • карточки
  • видео
  • аудио (подкаст/радиовыпуск)
  • лонгрид
  • физикализация
  • мерч
  • бот
  • приложение
  • интерактив
  • игра
  • наружная реклама
  • стикеры
  • художественная иллюстрация
  • карикатура
  • открытки в вотсапе и т.д.
Секрет 1

Датафикация критикуется за чрезмерное слежение за людьми, однако она позволяет вскрыть и решить проблемы.

Секрет 2

Самая выгодная стратегия сторителлинга — поместить в центр повествования человека,

а человек живёт в городе.

Секрет 3

В центре повествования — человек. Лучше, когда человек в центре повествования — сам читатель.

Автокалендарь на основе Google Трендов
  • Новый год москвичи хотят встретить с новой машиной. Потому зимой они часто ищут, как купить автомобиль выгодно.
  • Весной все вспоминают про утилизацию зимних шин.
  • В теплое время года водители отправляются в отпуск всей семьей. Для этого они перевозят свои машины в другие города или берут напрокат семейные автомобили.
  • Осенью москвичи активно ищут, где можно ставить автомобиль на стоянку и как запустить двигатель при разряженном аккумуляторе.

https://t.me/DtRoad/42204
Портреты нарушителей дорожного движения
  • 30% автомобилистов, которые попали в ДТП, имеют стаж вождения более 20 лет.
  • Молодые люди, которые недавно сели за руль, часто не понимают габариты автомобиля и поэтому нарушают ПДД. Они чаще других наезжают на препятствия и стоящие машины.
  • Люди среднего возраста чувствуют себя на дорогах уверенно и нередко осмеливаются выехать на встречную полосу. Это приводит к столкновениям.
  • Люди старшего возраста хуже замечают пешеходов и велосипедистов, поэтому часто не пропускают их.

https://t.me/DtRoad/41492

Секрет 4

Крутые проекты от посредственных в первую очередь отличает желание их создателей сделать что-то крутое.

  • Для подбора музыки использовалась нейросеть DeepSeek.
  • Запрос: «Подскажи, какие произведения классической музыки ассоциируются с сердцебиением?».
  • Ответ: «Иоганн Штраус II – Ускорительный вальс (Accelerationen Walzer, Op. 234). Начинается медленно, но постепенно ускоряется, как будто сердце замирает, а затем бьётся всё быстрее».
Сколько блинчиков вам нужно для счастья и продуктивной работы?

Используйте визуальные метафоры.


Здесь блинчик — это

  • а) элемент декора;
  • б) пайчарт;
  • в) элемент пиктографической диаграммы, отражающей долю от целого;
  • г) элемент пиктографической диаграммы, отражающей распределение голосов — альтернатива барчарту.

https://t.me/DtRoad/45618

Секрет 5

Сначала думайте так, как если бы у вас были все деньги мира.


Потом думайте так, как будто денег у вас нет совсем.

Секрет 6

Иногда лучше не мудрить.


Что на вашем месте сделал бы

уставший и ленивый человек?

Иногда просто картинки достаточно

Задача: из всех улиц отсортировать и убрать дворы.


«Умный» человек: решит с нуля продумывать методологию, задаваясь философским вопросом, что есть двор и как его определить.


Уставший и ленивый человек: вглядится в датасет, увидит у некоторых улиц характеристику «Внутриквартальный проезд», сопоставит с картой и поймёт, что именно так и кодируются дворы. Удалит все дворы за пару кликов.

Секрет 7

Итог всего — также одно предложение.

Формулируйте Takeaway message.


Что читатель унесёт с собой?

Секрет 8

У карточки должен быть по-хорошему

кликбейтный заголовок.


Чтобы исследование хорошо распространялось,

в нём должна быть новость с цифрой.

То, что ценно и интересно исследователям,

не всегда интересно и ценно для СМИ. Поэтому исследования не получают должного охвата.


Здесь, например, новость могла бы звучать так:


«Ростов-на-Дону оказался самым "пробочным" городом в России: в вечерний час пик скорость здесь падает до 43% от разрешённой».

Секрет 9

Часто лучше не доказать, а объяснить и показать.

Секрет 10

Умейте быть хейтером своих работ.


Основные риски: политика, дизайн, двусмысленные формулировки, злоупотребление добром.

Какие риски не были предусмотрены в Google Maps?

  • Отрисовка границ зависит от вашей геолокации. Однако некоторых границ вообще нет: например, в 2016 году пользователи заявили о пропаже Палестины, которой никогда не было на картах.
  • Лейбл Nigga house на Белом доме во время президентства Барака Обамы и улица Гитлера в Германии.
  • Тег бизнеса Black-owned может использоваться не только для репрезентации, но и для точечных расистских нападений.
  • Нет актуальных перекрытий и изменений дорожного движения.
  • Опасная маршрутизация из-за недостоверных и неактуальных данных: палестинская девушка приехала прямо к израильской военной базе из-за Google Maps.
  • Некорректное отображение мест, таких как трущобы Кибера в Найроби.
  • Не учитываются ареалы обитания животных, например плотина бобров длиной 800 м в канадской провинции Альберта.
Профессиональный хейтер
Тип комментатора, который стремится оскорбить так, чтобы людям было максимально противно читать эти слова. Часто анонимны и недоговороспособны.

Цель — вызвать негативные эмоции у других людей.

Хейтеры есть всегда, вне зависимости от политической ориентации и тематики вашего издания.

Слева — комментарий к карточкам ЦОДД (см. выше), справа — комментарий к посту медиа «Если быть точным».
Источники данных
Обычно нужные данные можно найти, просто загуглив «тема данные» или «статистика», например environmental data, но вот несколько ключевых сайтов, где можно найти много полезных датасетов.

Открытые данные — всемирный уровень
  1. UNData — ООН.
  2. World Health Organization — Всемирная организация здравоохранения.
  3. World Bank — Всемирный банк.
  4. UNCTADStat — Конференция ООН по торговле и развитию.
  5. UNESCO: Общая статистика и Всемирная база данных о неравенстве в образовании.
  6. Eurostat Database — Евросоюз.
  7. Отчёты консалтинговых компаний, например, McKinsey & Company.

Негосударственные агрегаторы данных — всемирный уровень
  1. Dateno — поисковик по данным мира, создан российскими разработчиками.
  2. Our World in Data.
  3. Gapminder.
  4. Statista.com — 🌻 Важно! Для просмотра некоторых данных нужна платная подписка; у таких данных будет бело-зелёный крестик в правом верхнем углу картинки. Статистика без такого крестика доступна бесплатно.
  5. OCCRP Aleph — данные Центра по исследованию коррупции и организованной преступности, доступ с VPN, подходят для расследовательской журналистики.
  6. Data.world.
  7. Kaggle — можно наткнуться на необычные датасеты, например "Best Books Ever", "Reddit Dad Jokes", "Naughty or Nice List 2021", "French Second Hand Cars", "List of Colours" — посмотрите на популярные датасеты.
  8. Аналитика поисковых трендов: Google Trends и Яндекс Вордстат.





Российские данные
  1. Росстат — можно как скачивать статистику напрямую, так и запрашивать информацию.
  2. DataCatalogs — каталог каталогов данных, агрегатор различных источников.
  3. Стат ГИБДД — статистика аварийности Госавтоинспекции.
  4. Если быть точным — данные, собранные авторами проекта о социальных проблемах в России. 🌻 Важно! Использовать с осторожностью и по возможности самостоятельно искать данные в первоисточника, используя материалы Если быть точным только как подсказку.

Московские данные
  1. Портал открытых данных Москвы — официальные открытые данные Москвы, сгруппированные по темам.
  2. Единое хранилище данных — официальные открытые данные Москвы, сгруппированные по ответственным ведомствам.
  3. ПРОдвижение — немашиночитаемые, но ежедневно обновляемые данные о поездках на такси, каршеринге и арендных самокатах в Москве.
  4. Карта ДТП — аварийность в Москве.
  5. Компас Тинькофф — агрегированные данные о тратах москвичей по категориям.
  6. Яндекс Геоаналитика — есть данные по портрету населения, пешеходным потокам и по автомобильному трафику. Показатели по автомобильный трафику занижены, однако лучшего в открытом доступе нет, поэтому можно ориентироваться.

Данные отдельных стран
Во многих странах есть свои сайты открытых данных. Обычно они имеют gov в домене (то есть в адресе ссылки), например, https://www.data.gov.gr/ — открытые данные Греции.​
Источники вдохновения
Мой фаворит — пиксельный скроллителлинг:

Компьютерная лингвистика (анализ текста) как метод

Линейные графики

Точки





Забавный формат

Наш разнообразный мир

Не знаю, какая категория, но всё же

Премии по дата-журналистике и визуальному искусству
Необязательно делать масштабные работы
Иногда одной картинки достаточно
Как открыть CSV
Как открыть JSON
В Google-таблицы файлы json or xml можно загрузить напрямую.
1) Переформатируйте файл в CSV, например, на этих сайтах — JSON to CSV, XML to CSV.
2) Импортируйте результат в Google-таблицы как csv-файл.

Если у вас старая версия Microsoft Office (2013 и раньше), используйте ту же стратегию: переконвертируйте файл в csv, а затем импортируйте в Excel.

Иногда файлы с древовидной структурой, такие как json или xml, содержат много ошибок, и загрузить данные в табличку не получается. Скорее всего, это не ваша вина, а битый файл с ошибками структуры.
Проверьте «валидность» json-файла здесь и xml-файла здесь.
Как открыть XML
Как вытащить таблицы из PDF
Если у вас новый Office, функция встроена в Excel. Если у вас Office 2013 года и старше, скачайте Tabula и Java
Элементы интерфейса Excel на русском, английском и китайском языках
Папка с дата-каналами
This site was made on Tilda — a website builder that helps to create a website without any code
Create a website