Toolmap / фільми / Пошук шукає в індексі

Пошук шукає в індексі

Між запитом і першою десяткою результатів пошукова система робить кілька кроків. Від них залежить, що ви побачите і чому «не знайдено» ще не означає, що документа немає.

Фільм · близько 3 хв зі звуком · практикум «Пошук»

Широка версія для великого екрана

Спершу варто подивитись:

Гортай далі

    Текстом

    Те саме, що у фільмах: кожен кадр і його текст. Текст можна скопіювати і дати своєму асистентові разом із власним питанням.

    Пошук шукає в індексі

    1. Пошукова система не обходить інтернет у момент, коли ви вводите запит: на це пішли б години. Сторінки вона збирає заздалегідь. Цим зайнята програма, яку називають павуком: вона відкриває сторінку, зберігає копію і переходить за посиланнями далі. Нові адреси павук дізнається з посилань або з карти сайту, яку подає власник. Сторінку, на яку ніщо не посилається і якої немає в карті, він зазвичай оминає.

    2. Збережені копії розбирають на слова. Кожне слово зводять до початкової форми, щоб запит «договір» знаходив і «договору», і «договором». Із цих слів складають індекс, влаштований як покажчик у кінці книги: навпроти слова стоїть перелік сторінок, де воно трапляється. Тому пошук такий швидкий: система не перечитує сторінки, а дивиться в готовий покажчик. Свіжих змін на сайті в ньому може ще не бути.

    3. Запит «розірвання договору оренди» система розкладає на три слова і кожне шукає в індексі. Сторінки, де трапилося хоча б одне з них, стають кандидатами. На третій сторінці є всі три слова, на першій два, на четвертій одне, а друга, з новинами суду, до списку не потрапляє. Порядку серед кандидатів на цьому кроці ще немає.

    4. Кандидатів буває тисячі, і їх треба розставити за порядком. Система зважує сигнали, тобто ознаки, які можна порахувати: слова запиту в заголовку, посилання з інших сайтів, дата оновлення, місце і мова того, хто шукає. Тому сторінка з усіма словами запиту не обовʼязково перша: тут її випереджає зразок договору, на який посилаються частіше. Перша десятка відбиває цей порядок, а не правдивість написаного.

    5. Поза індексом лишаються сторінки за паролем, бази на зразок реєстру судових рішень, де результат дає лише форма пошуку, сторінки з позначкою noindex і нові, до яких павук ще не дійшов. Заборона в robots.txt ховає від павука текст, але адреса може зʼявитися у видачі. Скани Google іноді розпізнає сам, проте з помилками, тож на пошук по скану покладатися не варто.

    6. Напис «нічого не знайдено» стосується лише цього індексу: у ньому немає сторінок, які відповідають запиту. Сам документ при цьому може існувати, наприклад у базі, куди павук не заходить. У такому разі запит формулюють іншими словами, пробують іншу пошукову систему або шукають через форму самої бази чи реєстру.

    7. Коли кандидатів забагато, запит уточнюють операторами, тобто службовими позначками, які пошукова система розуміє як команди. Лапки залишають сторінки з точною фразою, мінус перед словом прибирає сторінки, де воно є, site: обмежує пошук одним сайтом, а filetype:pdf залишає лише файли PDF. У прикладі із сорока кандидатів після чотирьох операторів лишається три, і переглянути їх уже можна вручну.

    Далі