Датасети: що це таке і як їх знайти
Датасети - це основа аналізу даних та роботи зі штучним інтелектом. З їх допомогою навчають нейромережі, проводять дослідження та знаходять закономірності в інформації. У статті розповімо, що таке датасети, де їх знайти і як вибрати відповідні дані для ваших завдань.
Що таке датасет для аналізу даних
Датасети - Це організовані набори даних, які використовуються для навчання, тестування та валідації моделей машинного навчання. Вони є таблиці або колекції даних, де кожен рядок може відповідати окремому об'єкту чи спостереженню, а стовпці - різним характеристикам (фічам). Фіча (Особливість, ознака) - це характеристика або атрибут об'єкта, що є частиною вхідних даних, які використовуються для навчання моделі машинного навчання. Це може бути будь-яка змінна, що описує дані, наприклад, вік людини, колір автомобіля або кількість товарів у магазині. Мітка (цільова змінна, результат) - це значення, яке модель намагається передбачити або класифікувати на основі фіч. Наприклад, завдання класифікації може бути мітка класу (наприклад, «кішки» чи «собаки»), а задачі регресії — конкретне числове значення (наприклад, ціна будинку).
Встановлення датасету
- Підключити бібліотеку. Наприклад, torchvision (для PyTorch).
- Імпортувати датасет. Кожна бібліотека надає метод або клас для завантаження певного датасету.
- Вказати налаштування. Потрібно прописати, де зберігати дані, чи завантажувати їх автоматично, чи використовувати перетворення (наприклад, нормалізацію).
- Розділити дані. Також вказують, які дані є навчальними, а які тестовими (перевірочними).
Так виглядає встановлення датасету з бібліотеки torchvision:
від torchvision import datasets, transforms dataset = datasets.(root='шлях', train=True, download=True, transform=transforms.ToTensor())
Тепер розберемо, чим відрізняється навчання з учителем, без вчителя і з підкріпленнямякі датасети для цього використовують і за яким принципом їх обирають.
Навчання з учителем (Supervised Learning)
Навчання з учителем (контрольоване навчання) - це підхід, при якому модель навчається на датасетах з розмічених даних.
Розмічені дані — це набір прикладів, де кожен об'єкт (наприклад, зображення, текст чи числа) включає фічі та мітки. Завдання моделі - знайти залежність між ними, щоб передбачати результати нових даних.
Модель приймає розмічені дані, виявляє закономірності з-поміж них, створює зв'язку, а потім може класифікувати нові, нерозмічені дані. Джерело
Навчання з учителем використовують у завданнях класифікації і регресії.
Класифікація
Одне із найпопулярніших завдань машинного навчання. Для неї використовують датасети, що містять об'єкти з фічами та мітками класів (категорій). Модель навчається пророкувати клас об'єкта на основі фіч. Ось приклади датасетів для класифікації:
Сфера застосування: комп'ютерний зір.
Датасет із зображень у відтінках сірого розміром 28х28 пікселів, що містить рукописні цифри від 0 до 9. MNIST та його розширення засновані на NIST Special Database 19, більш ранньому датасеті з рукописних цифр та літер.
Набір даних: 70 000 зображень (60 000 навчальних та 10 000 тестових).
Приклад набору датасету MNIST.Джерело
Різновиди та розширення
Замість цифр містить зображення одягу.
Набір містить 70 000 зображень у відтінках сірого у 10 категоріях одягу.
Розширює MNIST, включає символи та цифри.
Адаптація MNIST під японські символи кани з повною заміною набору.
Приклад набору датасету KMNIST.
Сфера застосування: комп'ютерний зір.
Датасет із зображеннями розміром 32х32 пікселів з об'єктами 10 класів, таких як літаки, автомобілі, птахи, кішки тощо.
Набір даних: 60 000 кольорових зображень (50 000 навчальних та 10 000 тестових зображень).
Приклад набору датасету CIFAR-10
Різновиди та розширення
Розширює CIFAR-10. Містить 100 класів об'єктів (по 600 зображень на клас).
Заснований на CIFAR-10, включає зображення 10 класів, але вищої роздільної здатності (96×96 пікселів).
Незважаючи на те, що STL-10 заснований на CIFAR-10, він використовується швидше для завдань часткового навчання (з частковим залученням вчителя), оскільки крім маркованих зображень він містить 100 000 немаркованих (unlabeled).
Примірники даних у наборі STL-10.
Сфера застосування: комп'ютерний зір.
Набір даних, що містить зображення з анотаціями. Вони допомагають моделям навчатися виконання завдань комп'ютерного зору.
Набір даних: більше 320 000 анотованих зображень.
Приклад датасету MS COCO.
Різновиди та розширення
- COCO-Stuff.Розширення, яке включає додаткові категорії об'єктів, такі як різні типи фонів та фонових об'єктів.
- COCO-Keypoints. Версія, де анотовані ключові точки на людських постатях завдання розпізнавання поз.
- COCO-Text. Анотовані зображення для розпізнавання тексту на зображеннях (OCR).
Сфера застосування: Вивчення тенденцій у кіноіндустрії, рекомендаційні системи.
Датасет містить дані про фільми: текстові (назва, опис), числові (рейтинг, касові збори).
Набір даних: понад 50000 записів.
Станьте аналітиком даних та отримайте затребувану спеціальність
Сфера застосування: біоінформатика, аналіз даних.
Набір спостережень за квітками Ірис. Кожне спостереження характеризується чотирма ознаками, пов'язаними з розміром чашолистків та пелюсток, і відноситься до одного з трьох видів ірисів.
Характеристики ірисів у датасеті. Джерело
Набір даних: 150 спостережень, по 50 для кожного із трьох видів ірисів (Iris Setosa, Iris Versicolor, Iris Virginica).
Регресія
Регресія - Це завдання машинного навчання, в якій модель навчається передбачати числові значення на основі фіч. На відміну від класифікації, де мітки - це категорії, в регресії мітки є безперервні числові значення. Приклади датасетів:
Сфера застосування: освіта, аналіз даних, передбачення успіху у навчанні.
Датасет, розроблений для дослідження факторів, що впливають на академічну успішність студентів. Включає інформацію про різні характеристики студентів та їх оцінки.
Цільова змінна - індекс загальної успішності студента, виражений числом від 10 до 100. Вищі значення вказують на кращу успішність.
Набір даних: 10 000 об'єктів, кожен із яких описує різні аспекти навчальної діяльності студентів.
Сфера застосування: хімічний аналіз, контроль якості, передбачення якості.
Амбіційний проект з класифікації вин Датасет містить інформацію про хімічні характеристики вин та їх якість.
Набір даних: червоне вино – 1599 зразків, біле вино – 4898 зразків.
На сайті Kaggle можна знайти ще більше датасетів для різних завдань.
Датасети на сайті Kaggle.
Навчання без учителя (Unsupervised Learning)
Навчання без вчителя (неконтрольоване навчання) передбачає використання даних без міток.
Модель аналізує лише вхідні дані та намагається знайти приховані структури або патерни у даних. кластеризації і зниження розмірності.
Кластеризація - Це завдання групування об'єктів за ознаками таким чином, щоб об'єкти всередині однієї групи (кластера) були більш схожими один на одного, ніж об'єкти з різних груп.
Якщо в класифікації використовують уже розмічені дані, то в кластеризації класи свідомо не визначено.Модель повинна сама виділити групи подібних об'єктів.
Зниження розмірності — це спрощення структури даних, зменшення числа ознак із збереженням важливої інформації. Це допомагає у візуалізації даних, підвищенні ефективності алгоритмів та зменшенні обчислювальних витрат.
Модель одержує сирі дані, аналізує їх для виявлення прихованих структур або патернів.
У навчанні без вчителя використовують датасети, такі як:
Сфера застосування: маркетинг, аналіз даних, сегментація клієнтів, аналіз звичок купівлі.
Датасет необхідний угруповання клієнтів з урахуванням їх купівельних звичок з допомогою методів кластеризації. Його можна використовувати для машинного навчання без вчителя (наприклад, за допомогою алгоритму KMeans), щоб виявити різні сегменти клієнтів для подальшого аналізу та релевантного маркетингу.
Набір даних: 2000 об'єктів (клієнтів), 5 ознак (вік, дохід, бали лояльності).
Сфера застосування: обробка та аналіз текстів, виділення подібних тем та угруповання документів.
Датасет використовує тексти новин для виділення подібних тем та їх угруповання.
Набори даних: близько 18 000 повідомлень з 20 різних груп новин (наприклад, спорт, політика, релігія).
Сфера застосування: аналіз даних.
Каталог наборів даних, що містить різноманітні тестові дані на такі теми, як астрономія, економіка, соціологія, медицина та освіта для алгоритмів кластеризації.
На цьому сайті можна знайти безліч інших датасетів для різних цілей.
Навчання з підкріпленням (Reinforcement Learning)
Навчання з підкріпленням ґрунтується на взаємодії агента з навколишнім середовищем. Агентом може бути програма, алгоритм або система, що навчається на основі взаємодії з цим середовищем.
Агент робить дії, за які отримує винагороди або покарання, та використовує цей досвід для прийняття більш правильних рішень у майбутньому. Модель навчається з урахуванням отриманих результатів, а чи не на заздалегідь заданих мітках.
Наприклад, для навчання логістичного робота використовують навчання із підкріпленням. Робот стає агентом у складському середовищі. Він виконує дії, куди отримує зворотний зв'язок: винагороду чи уточнюючу інформацію з довкілля.Зворотній зв'язок допомагає агенту розробити стратегію майбутніх дій. Джерело
Чи існують датасети для навчання з підкріпленням?
Навчання із підкріпленням рідко використовує традиційні статичні датасети. Натомість застосовують середи і симуляціїякі дозволяють агенту взаємодіяти з динамічними станами.
Для навчання агентів існують спеціальні двигуни та платформи з готовими траєкторіями або симуляціями для навчання. Ось деякі з них:
Сфера застосування: робототехніка, симуляції руху та фізичні системи.
Потужний фізичний двигунпризначений для завдань оптимального управління, моделювання та аналізу складних систем. Його використовують для розробки алгоритмів управління та тестування перед впровадженням моделей у фізичних роботів, а також для візуалізації наукових експериментів та ігор.
Сфера застосування: Універсальна платформа для навчання агентів.
Набір симуляцій та середовищ, включаючи середовища із завданнями робототехніки, іграми та симуляцією фізичних процесів. Заснований на фізичному движку MuJoCo. Сумісний з багатьма фреймворками, такими як TensorFlow та Theano.
- CartPole. Утримання балансу маятника на візку.
- MountainCar. Управління автомобілем, який намагається подолати гору.
- LunarLander. Симуляція посадки місячного модуля.
- Atari Games. Класичні ігри Atari, такі як Pong та Breakout.
- Roboschool. Управління роботами зі складними рухами.
- Half Cheetah. Симуляція бігу гепарду.
- Walker2D. Балансування під час пересування людиноподібного робота.
- Humanoid. Складне керування людиноподібною моделлю.
Сфера застосування: робототехніка та фізичні симуляції.
Процес навчання агентів. Джерело
Готовий набір завдань з інтерпретованими винагородами (відповідно до «переваги» агента).Так само, як і OpenAI Gym, заснований на фізичному движку MuJoCo та підтримує просту модифікацію.
Як і OpenAI Gym, підтримує такі завдання, як Cartpole, Half Cheetah.і т.д.
Загальні критерії вибору та підготовки датасету
- Розмір та репрезентативність
Датасет має бути досить великим та різноманітним. Чим більше даних, тим краще модель зможе виявити закономірності. - Якість даних
Дані потрібні очистити від перепусток, помилок, шумів та дублікатів. Якість даних безпосередньо впливає точність моделі. - Баланс класів
У завданнях класифікації важливо, щоб усі класи були рівномірно представлені, інакше модель може бути схильна до домінуючого класу. - Актуальність даних
Дані мають відповідати поточним умовам завдання. Застарілі дані можуть погіршити продуктивність моделі. - Доступність та формат
Датасет повинен бути легко доступним і мати формат, сумісний з інструментами обробки (CSV, JSON тощо).
Як створити свій датасет
Хоча існує безліч готових датасетів, іноді може знадобитися створити власний. Орієнтовний план дій:
Збирайте дані з доступних джерел. Можна зібрати дані вручну, але є й автоматичні методи. Наприклад, соцмережі та карти надають API для доступу до своїх даних.
Або можна скористатися веб-скрейпінгом. У Python для цього є спеціальні бібліотеки, такі як BeautifulSoup, Scrapy або Selenium.
Позбавте датасет від «сміттєвих» даних та перепусток.
- Форматуйте та організуйте дані.
- Наведіть дані до стандартизованого формату, наприклад, CSV, JSON, або TFRecord для TensorFlow.
- Якщо це зображення, переконайтеся, що вони мають однакові розміри та формат.
- Розділіть дані на тренувальні та тестові. Класичне співвідношення: 80% для навчання та 20% - для тестування.
- Використовуйте бібліотеки для роботи з датасетами. Наприклад, у Hugging Face є інструкція зі створення та використання власних наборів даних.
Аналітики впливають на зростання бізнесу. Вони з'ясовують, який товар і коли більше купують. Вважають юніт-економіку. Оцінюють окупність рекламної кампанії. Тому компанії шукають та переманюють таких фахівців.
Які датасети бувають?
У цій статті ми розберемося, що таке датасети, як вони використовуються для аналізу даних, як створити розмічений датасет і навіть як замовити датасет за своїми потребами.
Простими словами, датасет — це організований набір даних, придатний для аналізу, дослідження та використання різних обчислювальних задачах. В основному, датасети є таблицями або матрицями, де кожен рядок відповідає окремому спостереженню, а кожен стовпець — ознакою або атрибутом, що описує це спостереження.
Уявіть собі, що ви збираєте інформацію про продаж у вашому інтернет-магазині. Ви записуєте кожну покупку до таблиці, де у вас є стовпці для імені покупця, товару, ціни та дати покупки. Ця таблиця із записами про продаж - це і є ваш датасет. Він містить дані про покупки, які ви можете аналізувати, щоб зрозуміти, які товари користуються великим попитом, як змінюється продаж у часі та багато іншого.
Для машинного навчання особливо важливим є поняття «розміченого датасету». Розмічений датасет включає у собі як самі дані, а й мітки чи відповіді, які дозволяють моделі машинного навчання вчитися цих даних.Наприклад, якщо у нас є датасет зображень тварин, розмічений датасет буде включати не тільки самі зображення, але й інформацію про те, які зображення містять кішок, а які - собак.
Розмічені датасети є ключовим ресурсом для навчання та оцінки моделей машинного навчання. Вони дозволяють моделям вчитися на прикладах і робити передбачення чи класифікації нових даних.
Датасет: види, застосування, набір кращих
Датасет є набір даних, які використовуються в різних видах аналізу та машинного навчання. Причому успішність останнього безпосередньо залежить від обсягу вихідної інформації: чим її більше, тим якісніше розвиватиметься ІІ.
Очевидно, що збирати великий обсяг даних вручну складно та не завжди доцільно. У нашій статті ми розповімо, які бувають датасети, як вони формуються, та запропонуємо набір із найкращих варіантів у різних галузях.
Поняття та завдання датасету
Оброблена та структурована інформація, представлена в табличному вигляді, називається Dataset. У такій таблиці об'єктами називають рядки, а ознаками – стовпці. Сукупність цієї інформації називається розміченими даними, які є основою машинного навчання .
Поняття та завдання датасету
Формат поданої інформації може бути різноманітним. Наприклад, якщо є необхідність додати в додаток голосовий пошук, достатньо надати нейронної мережі дані, в яких є жива мова. Для полегшення розпізнавання запитів штучним інтелектом слід використовувати якнайбільше прикладів. Під прикладом розуміється фрагмент запису промови в аудіо-форматі, зазначені у ній частини та його переклад.
Під будь-які завдання є певний вид розмітки даних:
- виділення 2D та 3D об'єктів;
- сегментація об'єктів;
- сортування зображень за категоріями;
- класифікація текстів;
- транскрипція рукописного тексту;
- аналіз тональності текстів;
- розпізнавання сутностей у тексті;
- транскрибація мови.
Команда GeekBrains спільно з міжнародними фахівцями з розвитку кар'єри підготували матеріали, які допоможуть вам розпочати шлях до професії мрії.
Добірка містить тільки найбільш затребувані та високооплачувані спеціальності та напрямки в IT-сфері. 86% наших учнів за допомогою цих матеріалів визначились із кар'єрною метою на найближче майбутнє!
Завантажуйте та використовуйте вже сьогодні:
Топ-30 найбільш затребуваних та високооплачуваних професій 2023
Допоможе розібратися в актуальній ситуації на ринку праці
Добірка 50+ безкоштовних нейромереж для спрощення роботи та збільшення заробітку
Тільки перевірені нейромережі з доступом з Росії та вільним використанням
ТОП-100 майданчиків для пошуку роботи від GeekBrains
Список перевірених ресурсів реальних вакансій із доходом від 210 000 ₽
Розмітка даних є досить стомлюючим та рутинним процесом. Наприклад, потрібно зробити так, щоб програма могла по фотографії розпізнати домашніх тварин. Для вирішення цього завдання слід провести виділення кішок на кількох тисячах зображень. В результаті цих дій мережа визначає, чи є на фотографії зображення кішки чи ні.
Але якщо на картинці зображені собаки, мавпочки, хом'ячки або будь-які інші тварини, то штучний інтелект ніяк на них не відреагує. Це вказує на необхідність зробити ще дуже великий обсяг роботи, результатом якого стане розміщення всіх тварин, які нас цікавлять.
Поняття та завдання датасету
Вирішення цього завдання ускладниться у кілька разів у разі, якщо потрібно визначити як вид тваринного, а й його породу. Тоді крім визначення класифікації на вигляд, необхідно зробити підрозділ їх по породах, що тягне за собою безліч розмічених зображень.
Види датасетів
З наукового погляду існує три категорії датасетів:
Простий запис
Це найпростіша категорія, при якій не простежується явний зв'язок між рядками-спостереженнями або стовпцями-ознаками, при цьому для кожного рядка характерний однаковий набір характеристик. Як правило, такі записи зберігаються або у файлах формату .csv, .parquet, або у реляційних базах даних.
Прості записи мають кілька підвидів:
Прикладом можуть бути покупки в магазині. Найчастіше зустрічаються двійкові ознаки, якими можна дізнатися чи було здійснено купівля якогось предмета чи ні.
Якщо кожен об'єкт колекції має однаковий фіксований набір ознак у числовому вираженні, то останні можна розглядати як Вектори в багатовимірному просторі. Певну кількість таких записів можна розглядати як Матрицю m х n, у якій є m рядків, для кожного об'єкта по одному, і n стовпців, для кожної ознаки по одному.
Виходячи з цього напрошується висновок, що перетворення даних та здійснення управління ними, допустимо проводити за допомогою стандартних матричних операцій. Для більшої кількості статистичних даних матриця є стандартним форматом.
Характеризується тим, що на відміну від матриці даних, має асиметричні ознаки, тобто важливе значення надають лише ненульовим значенням.
Графи
Є дані, що мають зв'язок між об'єктами. Графи структуруються, вузлові компоненти мають певний взаємозв'язок між собою.
Упорядковані записи
Частина даних упорядкована у просторі чи часі. Вони бувають такими:
- Послідовними. Ці дані утворені наборами окремих об'єктів – словами або літерами, не мають тимчасових міток, але мають позиції в упорядкованій послідовності.
- Тимчасовий ряд. Різновид даних послідовного типу, де будь-яка запис представлено вигляді часового ряду, тобто. серії змін.
- Просторовими. Ці дані характеризуються наявністю координат.
Характеристики датасету
Основні параметри датасетів:
- Розмірність - Вказує, скільки ознак має набір даних. Якщо розмірність висока, то аналіз такого набору даних буде складно.
- Розрідженість - Показник, що характеризується заповненістю датасета, тобто. ті осередки, які заповнені ненульовими значеннями. Для деякої кількості наборів даних, що мають асиметричні функції, велика кількість ознак показують нульове значення, і лише не більше 1% записів зустрічається з ненульовим значенням.
- Дозвіл. Характеризується можливістю виявляти якесь явище, за умови, що дані докладні рівно настільки, наскільки це відповідає розв'язанню задачі. Наприклад, переміщення циклону можна відобразити за зміною тиску, але в масштабі декількох місяців це явище незначне.
Вибірка для датасету
Генеральна сукупність – це початковий набір вихідних даних. Процес утворення вибірок із генеральної сукупності є породженням даних.Кінцеве підмножина елементів генеральної сукупності називається вибіркою.
Уважно вивчивши кінцеве підмножина, стає зрозумілою поведінка вихідної множини. Як приклад можна навести приклад, у якому генеральна сукупність сформована із 200 тисяч відвідувачів сайту, але у вибірці з них опинилися лише 300.
Очікувана модель породження даних передбачає, що вибірка з генеральної сукупності генерується випадковим чином. У випадку, коли вся множина її елементів однаково випадкова і незалежно один від одного розподіляються за вихідною множиною, то таку вибірку називають простою.
Даний тип вибірки представлений математичною моделлю серії незалежних дослідів, і за статистикою найчастіше застосовується для навчання машинного вигляду. Слід пам'ятати, що у кожен етап такого освітнього процесу потрібен певний набір даних:
- Навчальна вибірка необхідна безпосереднього навчання моделі. По ній роблять налаштування та оптимізацію параметрів моделі.
- Контрольна або тестова вибірка застосовується, якщо потрібно оцінити якість моделі. В ідеалі ця вибірка має бути незалежною від навчальної.
- Валідаційна або перевірна вибірка використовується при виборі найкращої моделі для машинного навчання. Так само як і попередній виробіток, цей не повинен перегукуватися з навчальною.
- Інтелектуальний аналіз інформації, вибірка, датасет, Data Peperation.
Методи, якими формуються навчальні та оціночні вибірки, залежить від класу завдання, чиє рішення відбувається з допомогою машинного навчання:
- Для визначення завдань класифікації весь обсяг даних необхідно розділити таким чином, щоб в утворених наборах співвідношення чисельності об'єктів різних класів було аналогічно вихідної генеральної сукупності.
- Для вирішення задачі при регресивному аналізі слід однаково розподілити цільову змінну в отриманих наборах, які в майбутньому застосовуються для навчання та контролю якості.
Після формування вибірки приходить послідовність наступних процесів CRISP-DM: очищення даних та дії з ознаками:
- генерація;
- трансформація;
- нормалізація та відкидання зайвої змінної.
Всі ці дії спрямовані на виключення мультиколінеарності факторів та зниження розмірності моделі машинного навчання.
Найкращі датасети для аналізу та машинного навчання
Датасети загального призначення
- Data.gov. Тут є інформація від різних організацій США. Дані можуть бути абсолютно різними, від державного бюджету до позначок у шкільному табелі.
- Food Environment Atlas. Включає в себе відомості про вплив різноманітності факторів на критерії вибору харчування в США та його якості. З показників слід зазначити відстань до магазину чи ресторану, вартість продуктів, виробника та інші.
- School system finances. Інформація про фінансовий стан шкільної системи США.
- Chronic disease data. Цей датасет містить інформацію про хронічні захворювання США.
- The US National Center for Education Statistics. Містить дані про освітні заклади та демографію не тільки в США, а й по всій планеті.
- The UK Data Service. Найбільше сховище інформації соціальної, економічної та демографічної спрямованості у Великій Британії.
- Data USA. Детальна візуалізація даних загального доступу США.
- Boston Housing Dataset. Тут можна побачити відомості про житловий фонд у Бостоні, яке зібрало бюро, яке здійснює перепис населення США.
- Quandi. Є непоганим джерелом інформації економічної та фінансової спрямованості. Використовується для будівництва прогнозних моделей різних даних економіки чи котирувань акцій.
- Word Bank Open Data. Включає певні інформаційні комплекси, де відображається демографічна ситуація, різноманітні економічні показники та індикатори розвитку у всьому світі.
- IMF Data. Містить відомості міжнародного валютного фонду про світові фінанси, боргові критерії, резерви валют, інвестиційні рекомендації та вартість основних сировинних товарів.
- Financial Times Market Data. Найбільш точна інформація про фінансовий ринок у всьому світі, у тому числі індекси вартості акцій, товарів та валют.
- Google Trends. Тут можна дізнатися та проаналізувати відомості щодо активності пошукових систем у мережі.
- American Economic Association. Непогане місце для пошуку інформації про макроекономічні показники США.
Датасети для машинного навчання
- xView. Є найбільшим із усіх наборів повітряних знімків землі загального доступу. Тут містяться картинки різних сцен з усіх куточків нашої планети, анотовані за допомогою різних обмежень.
- Labelme. Включає велику кількість анотованих картинок.
- ImageNet. Датасет, де можна знайти зображення для новостворених алгоритмів.
- LSUN. Масив картинок, відсортованих за різними критеріями.
- MS COCO. Тут можна знайти все, що потрібно для виявлення та сегментації об'єктів.
- Visual Genome. Розміри датасета з детально анотованими зображеннями є найбільшими.
- Google's Open Images. Включає колекцію з більш ніж 9 мільйонів URL-адрес, що мають мітки та охоплюють велику кількість категорій під ліцензією Creative Commons.
- Labelled Faces in the Wild. Включає зображення понад 10000 осіб для застосування додатків, в основі яких лежить розпізнавання осіб.
- Stanford Dogs Dataset. Аналіз датасету дозволить розпізнати зображення із певних порід собак.
- Indoor Scene Recognition. Один з найбільших датасетів у плані впізнавання інтер'єрів. У ньому міститься 67 категорій, що включають 15 620 картинок.
Щоб зареєструватися на безкоштовний інтенсив і отримати в подарунок добірку файлів від GeekBrains, заповніть інформацію у вікні
- Multidomain sentiment analysis dataset. Достатньо віковий проект, в якому міститься інформація про товари, куплені на Amazon.
- IMDB reviews. Маленький ресурс із тематикою «відгук до фільмів».
- Stanford Sentiment Treebank. Проект Стенфортського університету, де аналізують тональність.
- Sentiment140. Модний портал, в якому можна знайти безліч твітів із віддаленими смайликами.
- Twitter US Airline Sentiment. Тут знаходяться дані з Twitter про всі компанії авіаперевізників США.
Чи залучає світ кодування та створення програм? На курсі програміста з нуля до Junior ви освоїте основи, познайомитеся з мовами та інструментами розробки та готові до створення своїх перших проектів в IT-індустрії.
Обробка природної мови:
- HotspotQA Dataset. Ресурс, в якому містяться запитання та відповіді. З його допомогою можна створити систему стандартних відповідей.
- Amazon ReviewsТут накопичилося величезна кількість відгуків з однойменного ресурсу за вісімнадцятирічний період.
- Google Books Ngrams. Включає колекцію слів із книги Google.
- Wikipedia Links dataЦей проект побудований з веб-сторінок, причому на кожній є одне посилання на Вікіпедію та її якірний текст аналогічний заголовку сторінки.
- Gutenberg eBooks List.Датасет з анотованим списком електронних книг проекту «Гутенберг».
