Глава 8
Страница 54 из 94
Настройки чтения
18px
1.8
1

Глава 8

Страница 54

Зато у меня появилась отличная идея: начать просеивать Валентию заранее. Пускай у нас пока нет самого поисковика, ничто не мешает начать создавать для него пищу.

Нам нужна программа-алгоритм, которая будет автоматически собирать ссылки и семантику. Я взял чистый лист и снова нарисовал схему. Загружаем сто самых популярных сайтов Валентии. Дальше программа открывает каждый из них, видит размещённые на страницах ссылки и проходит уже по ним. На новых страницах обнаруживает следующие, открывает их, затем следующие — и так всё глубже, пока перед ней не начинает расползаться огромная паутина местного интернета.

Один сайт ведёт на десять других, те — ещё на сотню, сотня превращается в тысячи. Ручками подобное не переберёшь даже армией студентов, а машина будет заниматься этим круглосуточно, день за днём, ночь за ночью. Причём запоминать она должна не только адреса: название страницы, заголовки, текст, внутренние ссылки, возможно, отдельные слова и частоту их появления, когда последний раз менялась страница, откуда мы на неё пришли и куда можно уйти дальше.

Грубо говоря, конспектировать интернет, создавая огромную библиотеку.

Следующий этап уже знаком. Человек открывает будущую программу-оболочку и пишет: «социальная сеть Vida». Запрос разбивается на слова, другой алгоритм лезет в подготовленную библиотеку, находит страницы, где встречаются нужные сочетания, сравнивает их по набору правил и формирует выдачу.

Внутри, конечно, чёрт ногу сломит. Морфология, одинаковые слова с разными значениями, мусорные страницы, дубли, сайты, которые специально будут пытаться обмануть систему, обновления, скорость обработки и ещё сотни вещей, половины которых я даже не помнил. Но на бумаге схема выглядела почти издевательски просто: алгоритм, собирающий данные, гуляющий по ссылочной базе и зарывающийся всё глубже и глубже. Одним словом — индексация.

Дальше начиналось самое вкусное — приоритизация показов.

Я задумчиво постучал ручкой по столу. Google в моём мире выстрелил не потому, что первым додумался искать слова на страницах. Главной магией было другое — умение понять, какую из десяти тысяч страниц стоит показать человеку первой.

PageRank.

Каждая страница получает свой вес. Если на неё ссылаются другие сайты, это вроде голосов доверия. Если же ссылается крупный и сам по себе важный ресурс, такой голос весит больше, чем ссылка из какого-нибудь заброшенного дневника. Получается целая система авторитетов.

Я дописал на листе: «Ссылочный вес».

На первом этапе можно было бы этот момент отсечь. Сделать приоритизацию вручную хотя бы для крупнейших компаний. Чтобы по всем вариантам запроса «Леон-Моторс» первым появлялся официальный сайт Габриэля, по «Периодике» — газета Тайрона, по «Виде» — мы. Просто создать список исключений.

назадназад
1 ... 52 53 54 55 56 ... 94
впередвперед