Ключевые пециалисты по поиску Yandex Андрей Плахов и Андрей Гулин


рассказали searchengineland о «Матрикснете«, «Спектре» (технология понимания пользовательских запросов) и и поведенческих факторах.
В свете борьбы с «платными ссылками» было упомянуто, что некоторые из таковых БУДУТ УЧИТЫВАТЬСЯ — но с «очень-очень качественных сайтов»©,
ps: по-моему, подобные учитывались Яндексом всегда, и уж точно — с этого нового года.
а высокая клибельность сайта не всегда даст «плюс» в ранжировании (см. «сайт хороший») — ибо таковое может быть от порносайта, оказавшегося в выдаче по «приличному» запросу
зы: характерная особенность Яндекса на протяжении всего его существования — говновыдача по любому, в т.ч. коммерческому запросу с деквизом: хочешь «правильно ранжироваться — вперед на директ!«
Google никогда не подтверждал, что он использует клики пользователей в своих алгоритмах, но Андрей Гулин считает, что без обработки поведенческих данных хороший поисковик сейчас сделать нельзя. А Google — хороший поисковик, значит, он такие данные использует.
Известно также, что Google очень ограниченно, по сравнению с Яндексом, использует машинное обучение (на котором построен «Матрикснет») в своих поисковых технологиях (зато активно использует в рекламных). На сайте Quora.com, где общаются специалисты из зарубежных IT-компаний, обсуждается вопрос о причинах такого подхода.
Бывший гуглер Эдмонд Лау называет причины, удивительно похожие на те, по которым «Матрикснет» не нравится оптимизаторам. В случае с машинным обучением оказывается трудно понять, почему именно этот документ определенным образом ранжируется по определенному запросу. Алгоритм превращается в «черный ящик», и даже его создатели часто не могут восстановить цепочку «рассуждений» и набор факторов, которые привели алгоритм к тому или иному решению. Во-вторых, даже если удалось определить сигналы, которые к решению привели, а решение это оказалось неправильным, алгоритм очень трудно настроить вручную, чтобы он какие-то сигналы не учитывал, чтобы он воспринимал их в контексте и т.д. Алгоритму можно только «скормить» определенные данные, а как он их использует после обработки — неизвестно. Недостаток прямого контроля создает ситуации, когда человек чётко знает, что одна страница релевантнее другой по заданному запросу, а вложить это знание в машину оказывается не в силах. Особенно если в его знании участвует интуиция.
Поисковый алгоритм Google основан на правилах, что позволяет программистам точечно «подкручивать веса» в специфических ситуациях. Только за 2008 год было внедрено 450 таких точечных улучшений алгоритма, а доминирование Google в поиске позволяет считать такую технологию успешной.
Почему же машинное обучение используется Google для ранжирования рекламных объявлений? Лау считает причиной тот факт, что человеку гораздо труднее сравнить два объявления на предмет качества, чем два сайта. Поэтому сравнение нужно отдать машине. Тем более, для ранжирования объявлений нужно учитывать поведенческие данные, с чем машина справляется лучше человека.
Еще один «бывший сотрудник большого поисковика» анонимно добавляет, что в случае с рекламой от решений алгоритмов зависят доходы Google и счастье рекламодателей, поэтому лучше, чтобы объявления ранжировали роботы по объективным признакам.