Як комп'ютер отримує інформацію, якої спочатку в ньому не було — від датчика й сканера до OCR, розпізнавання мовлення та пошукових систем. І чому добути інформацію ще не означає отримати правду.
Три запитання, на які ми відповімо протягом уроку. Спробуйте відповісти зараз — а наприкінці перевіримо.
Чи може комп'ютер його прочитати — не як картинку, а як слова, які можна редагувати?
Чи може комп'ютер перетворити її голос на текст?
А якщо потрібно визначити температуру в кімнаті — звідки комп'ютер її візьме?
Усі приклади, які ми розглянемо, влаштовані однаково. Змінюються лише пристрій і програма.
Добування інформації — це отримання потрібних даних із певного джерела за допомогою технічних і програмних засобів.
отримує зображення
отримує звук
отримує цифрову копію документа
отримує текст із зображення
знаходить інформацію в інтернеті
отримує дані про навколишнє середовище
Кожен пристрій «спеціалізується» на своєму типі даних — універсального не існує
Камера не знає, що на знімку — автомобіль. Мікрофон не знає, що прозвучало слово «погода». Сканер не знає, що на аркуші — контрольна робота.
Той самий приклад на трьох етапах: датчик температури в кабінеті інформатики
Датчик передав число. Це дані — саме по собі це просто число, воно нічого не означає.
Програма знає, що це градуси Цельсія, а не вологість і не номер кабінету.
Це вже інформація: її можна зрозуміти й ухвалити рішення — провітрити кабінет.
Людина сприймає світ органами чуття, комп'ютер — пристроями. Логіка та сама.
Людина бачить лише вузьку частину випромінювання — видиме світло. А що поза цими межами?
бачить тепло крізь темряву — інфрачервоне випромінювання
вимірює радіацію, яку людина не відчуває ніяк
визначає напрям магнітного поля Землі
«чує» Wi-Fi та мобільний сигнал
Найкращий приклад того, як технічний і програмний засіб працюють у парі
OCR (Optical Character Recognition) — оптичне розпізнавання символів: програма аналізує зображення й намагається визначити, які саме символи на ньому зображені.
Програма порівнює форму на зображенні з відомими їй обрисами літер
Так само розпізнаються цифри та розділові знаки
Символи складаються у слова, а знання мови допомагає виправити сумнівні місця
Беремо фотографію сторінки підручника — і пробуємо просто зараз
Google Перекладач → «Камера»; Google Об'єктив; у Нотатках iPhone — кнопка розпізнавання тексту
Google Диск: завантажити зображення → відкрити через Google Документи — текст розпізнається автоматично
Багатофункціональні пристрої часто мають режим «сканувати в текст» — це той самий OCR, вбудований у прошивку
Спеціально даємо OCR перекошений, темний, розмитий знімок — і розбираємо причини
Результат роботи будь-якої системи розпізнавання — це гіпотеза, а не істина. Її потрібно перевіряти.
Той самий ланцюжок, але вхід — не зображення, а звук
Спочатку відповідають учні — потім перевіряємо
Камера дає пікселі. Висновок про те, що на них зображено, робить програма.
Мільйони пікселів різного кольору — для пристрою це просто таблиця чисел
Шукає знайомі ознаки: контури, форми, пропорції — і робить висновок
Текстове твердження, з яким уже можна щось робити
Computer Vision — комп'ютерний зір: напрям, що вчить програми розпізнавати об'єкти на зображеннях і відео.
Місцезнаходження зазвичай визначається не одним джерелом, а кількома одночасно
сигнали супутників — найточніше просто неба
перелік мереж поруч — працює в приміщенні
вежі зв'язку — грубо, але майже завжди доступно
компас і акселерометр — напрям і рух
Від пристроїв переходимо до програм — тут інформація добувається не з фізичного світу, а з даних і мережі
знаходять потрібне серед мільярдів сторінок
дістають текст із зображень і сканів
перетворюють голос на текст
визначають об'єкти на зображеннях
автоматично збирають дані з вебсторінок
знаходять закономірності у великих масивах
узагальнюють і формулюють відповіді
дістають потрібні записи з баз даних за запитом
Ви пишете «Як працює сонячна батарея?» — і відповідь приходить за частку секунди. Це можливо лише тому, що більшу частину роботи виконано заздалегідь.
Web scraping — це автоматизоване отримання структурованих даних із вебсторінок.
Є 500 товарів. Відкрити кожну сторінку, скопіювати назву, ціну й рейтинг, вставити в таблицю.
Програма сама обходить сторінки й дістає потрібні поля в готову таблицю.
Не вся інформація з сайтів може вільно збиратися та використовуватися
Умови користування можуть прямо забороняти автоматичний збір. Багато сайтів також обмежують кількість звернень.
Персональні дані людей захищені законом — збирати й публікувати їх без підстав не можна.
Тексти, фотографії й бази даних мають власника. Зібрати ≠ отримати право використовувати.
Оберіть засіб — і поясніть, чому решта не підходять
Усі засоби, які ми розглянули, відповідають на питання «як дістати». Жоден із них не відповідає на питання «чи це правда».
швидко, але без жодної перевірки фактів
сайт може мати мету продати або переконати
відео теж монтують, а зараз і генерують
канал може бути анонімним — авторства немає
особистий досвід ≠ загальне правило
відповідає впевнено навіть тоді, коли помиляється
перше місце у видачі — не гарантія правдивості
питати: хто автор, коли опубліковано, на що спирається
Якщо штучний інтелект дав вам відповідь — чи є вона автоматично правдивою? Ні.
Добування — це лише перший крок із п'яти
Клас ділиться на групи. Кожна група отримує свій варіант, виконує його й доповідає: що добули, яким засобом і як перевіряли.
Знайти актуальну ціну певного товару на 3 сайтах і пояснити, чому вона різна
Знайти прогноз на завтра з двох джерел і порівняти розбіжності
Сфотографувати текст і розпізнати його — порахувати кількість помилок
Записати коротке речення голосом і перетворити на текст — перевірити точність
Знайти інформацію про певну технологію та перевірити її за трьома джерелами
Три завдання: обов'язкове, практичне й на вибір
Оберіть будь-який пристрій зі свого дому (смартфон, розумний годинник, пульт, камера) і запишіть для нього повний ланцюжок: реальний світ → пристрій → дані → програма → інформація.
Розпізнайте один і той самий текст із двох фотографій: якісної та навмисно поганої. Порахуйте помилки в обох випадках і поясніть різницю.
Знайдіть у соцмережах або в AI будь-яке конкретне твердження з цифрою чи датою. Перевірте його за трьома джерелами й напишіть, чи підтвердилося воно.
«Що сьогодні важливіше: вміти швидко знаходити інформацію — чи вміти визначати, якій інформації можна довіряти?»
Назвіть засіб добування інформації, яким ви користувалися сьогодні, навіть не помітивши цього.
Чому пристрій без програми не може дати інформацію — лише дані?
Що ви зміните у своїй роботі з інтернетом після цього уроку?