Дослідження датасета з IMDB

Дослідження датасета з IMDB

Проблематика

Фільми - це круто, фільми надихають нас, наповнюють упевненістю, загалом дають нам багато. І тому в цій статті я б хотів розповісти вам про дослідження тенденцій сучасного кінематографа за допомогою інструментів аналізу даних, який вже був презентований у фіналі Science Slam ITMO University 2.0. Повний випуск доступний тут.

Одного разу на Кінопоїську я натрапив на незнайомий фільм. Це виявився «Зелений Слоник» - горезвісна стрічка епохи VHS. Ті, хто чули про нього, можуть зрозуміти враження, які я відчув після прочитання сторінки про цей фільм на Вікіпедії...

Але дурних фільмів ставок ставу і чи варто їм взагалі приділяти хоч якусь увагу? І це дуже здивувало, адже як такий відвертий кінематографічний «шлак» набирає рейтинг вище середнього (за всіма фільмами).

І ось я, сповнений скептицизму і недовіри до Яндексу системі рейтингування, озброївся інструментами для аналізу і візуалізації даних на основі python стека (sklearn, pandas, matplotlib, numpy) і вирішив розібратися чому у подібних фільмів можуть з'являтися пристойні рейтинги. Під катом ви знайдете цікаві і неочевидні висновки про сучасний (і не дуже) кінематограф, а також багато ілюстрацій до них.

Дані насамперед

Отже, починати треба з пошуку даних, які ми власне і збираємося аналізувати. Звичайно, не дуже хотілося збирати дані вручну, а хотілося відразу зосередитися саме на їх аналізі. Тому я відразу почав шукати потрібний датасет в інтернеті. Знайшов його в тому місці, куди варто було зазирнути в першу чергу - на сайті kaggle.com. Це виявився датасет, що містить понад 5000 фільмів з відомого сайту про кінематограф imdb. У ознаковому описі кожного фільму містилося чимало категоріальних і речових ознак, з якими ви можете ознайомитися на сторінці датасета сторінки датасета.

Але оскільки мені спочатку був цікавий саме рейтинг Кинопоиска, пошук потрібного датасета продовжився. АПІ Кінопоїска виявився закритим, а писати парсер html сторінок сервісу було лінь не було часу через завал на навчанні. Тому я зважився і написав у службу підтримки Кінопоїска з проханням надати датасет для дослідження виключно в академічних цілях. На превеликий подив мені навіть відповіли, але відповіли негативно. В итоге найти ничего другого не удалось.Датасет с Кинопоиска я обязательно соберу, но не раньше, чем после сессии. А зараз для аналізу довелося взяти той датасет IMDB.

З чого складається стаття

Дослідження знайденого датасета розділилося на дві об'ємні частини:

  1. Навчання алгоритму передбачення (рейтинг фільму є цільовою міткою)
  2. Пошук цікавих і нетривіальних кореляцій у даних

У цій статті я хотів би приділити більше уваги саме другій частині дослідження, але лише зауважу, що в першій частині я пробував навчати велику кількість різних моделей. Точність передбачення, якої вдалося домогтися за допомогою градієнтного бустингу становить 0.4 бали (mse помилка) за шкалою IMDB. Але процес побудови передбачувальної моделі заслуговує окремої статті, а в цій пропоную зосередитися на другому пункті.

Почнемо

Другу частину свого дослідження я почав з того, що взяв алгоритм лінійної регресії з lasso регуляризацією, навчений у першій частині і побудував діаграму вагових коефіцієнтів ознак. Давайте поглянемо на неї:

Стовпчики «Режисер», «» [123] Актор «» відповідають кількості лайків на Facebook у відповідних особистостей. «Формат» - це співвідношення сторін картинки. «Особи» - це цікава речова ознака, що відображає кількість осіб на постері фільму. Значення інших ознак очевидне. На даній діаграмі можна відзначити кілька цікавих моментів:

  • Тривалість фільму дає позитивний внесок у рейтинг фільму (мабуть довгі фільми краще заходять глядачам)
  • Рік дає негативний внесок (тобто чим новіший фільм, тим більше ймовірність, що рейтинг виявиться низьким)
  • Кількість осіб на постері теж дає негативний внесок

Останній пункт у мене, як у шанувальника фільму «Готель Гранд-Будапешт», викликав обурення, але з алгоритмом не посперечаєшся.

Жанр

Тепер давайте поглянемо на, мабуть, головну ознаку кінострічки - «Жанр».

На першій діаграмі відображена перша топ десятка жанрів, на другій жанри з 11 по 20 місце за середнім рейтингом.

Виявляється найбільший рейтинг набирають документальні, біографічні та історичні фільми. Зі свого боку з великим відривом найменший рейтинг набирають фільми з жанру жахів.

Країна виробництва

Досить цікавий результат можна спостерігати на діаграмі, що відображає середній рейтинг фільму з різних країн. Давайте розглянемо топ шістку країн за середнім рейтингом:

Як бачимо найбільш рейтингові фільми (в середньому) знімають у Великобританії, після якої йде Франція, а ось Австралія на третьому місці стала досить цікавою несподіванкою. Особисто мені важко було відразу згадати хоч якийсь високорейтинговий фільм з Австралії. Погуглів, вдалося з'ясувати, що фільм "Божевільний Макс: Дорога люті ". А ось те, що американці, зайняли місце поза топ трійки, вельми дивує.

А тепер давайте поглянемо на фінансову складову - на витрати кожної з країн на своє кіновиробництво:

Тут все цілком очікувано, США лідирує з величезним відривом, правда це не зістикується з попередньою діаграмою. Виходить, що американці нераціонально використовують свої ресурси, раз витрачають більше, але за якістю програють. Хоча ніхто не заперечує, що вони можуть брати не якістю, а кількістю.

Час

Тепер давайте розглянемо як різні ознаки фільмів залежать від часу. На даному графіку відображається середній рейтинг фільмів в якийсь момент часу:

Можемо побачити, що середній рейтинг фільмів зростає назад пропорційно року випуску фільму.

У свою чергу цей факт не зістиковується зі змістом такого графіка:

На даному графіку відображена динаміка зміни середнього бюджету фільму. З останніх двох графіків можна зробити висновок, що з роками ми витрачаємо на фільми більше, а отримуємо їх за якістю нижче.

Також досить цікаву картину дала залежність середньої тривалість фільму від часу:

Можна бачити, що найтриваліші фільми знімали в 70і роки. Це дуже важко піддається поясненню і можна бути впевненим, що ніхто точної відповіді на це не знає. Можна лише припустити, що в 70і роки відео- і аудіоапаратура отримала серйозний розвиток, в той же час у режисерів і сценаристів було море ідей і тому їм було важко зупинити потік думок. А в наш час вже знято настільки багато фільмів, що вже важко придумати щось нове і тому фільми роблять коротшими.

Висновки

Як бачимо Data Mining дослідження дає досить цікаві результати і можуть бути використані для аналізу різних поточних процесів в одній з найбільш динамічних і швидкорозвивних індустрій світу. Хорошим прикладом використання цих залежностей на практиці є серіал «Картковий будиночок». Про те, як компанія Netflix підбирала режисерів і акторів за допомогою методів аналізу даних ви можете почитати тут.

Image