Интернет как глобальная информационная система

Информатика 11 класс Босова §16. Интернет как глобальная информационная система

§ 16. Интернет как глобальная информационная система

Информатика. 11 класса. Босова Л.Л. Оглавление


16.1. Всемирная паутина

Напомним основные понятия, касающиеся Всемирной паутины.

Веб-страница может содержать текст, мультимедийные объекты (графическую, аудио- и видеоинформацию), гиперссылки на файлы или другие веб-страницы, а также всевозможные активные компоненты, например формы, позволяющие установить обратную связь между пользователем и веб-страницей посредством типовых элементов управления (текстовых полей, кнопок и т. п.).

Гиперссылка — некоторое ключевое слово или объект в документе, с которым связан переход к другому документу. Текст, в котором используются гиперссылки, называется гипертекстом.

Веб-сайт — группа веб-страниц, связанных единой темой, общим стилем оформления и взаимными гиперссылками.

Браузер (от англ. browse — просматривать) — специальная программа для просмотра веб-страниц.

Современные браузеры обладают возможностями загрузки и отображения веб-страниц, сохранения веб-страниц на носителях данных, сохранения истории посещения веб-страниц, создания каталога избранных ресурсов, поиска на веб-странице фрагмента текста, просмотра HTML-кода веб-страницы, печати содержимого веб-страницы и др.

Веб-страница с точки зрения её разработчика — это файл, содержащий собственно текст, несущий определённую информацию для пользователя, и служебную информацию для браузера (тэги разметки) на языке HTML (англ. HyperText Markup Language — язык разметки гипертекста). Тэги разметки представляют собой определённые стандартом HTML последовательности символов, являющиеся инструкциями для программы просмотра. Согласно этим инструкциям, браузер располагает текст на экране, включает в него рисунки, хранящиеся в отдельных графических файлах, и формирует гиперсвязи с другими документами или ресурсами Интернета.

Веб-страницы предназначены для воспроизведения на самых разных экранах самых разных компьютеров. Поэтому они не имеют «жёсткого» форматирования. Оформление веб-страницы выполняется непосредственно во время её воспроизведения на компьютере клиента в соответствии с настройками используемого браузера.

HTML — один из так называемых «веб-стандартов» («стандартов Web»), по которым разрабатываются сайты во всём мире. Ещё одним из таких стандартов является технология CSS (англ. Cascading Style Sheets — каскадные таблицы стилей) — формальный язык описания внешнего вида документа, составленного с использованием языка разметки. Эта технология позволяет принципиально разделить содержание и представление документа:

• описание содержания и логической структуры веб-страницы производится с помощью HTML или других языков разметки;
• описание внешнего вида веб-страницы производится с помощью CSS.

Такое разделение позволяет применять единый заранее разработанный стиль оформления для многих схожих документов, а также быстро изменять оформление документов за счёт изменения этого стиля, хранящегося в отдельном CSS-файле. Перенос правил представления данных в отдельный файл ведёт к уменьшению времени загрузки страниц сайта — описание представления данных загружается браузером только один раз, а далее, при переходе с одной страницы сайта на другую, браузер загружает только структуру страницы и хранимые на ней данные. Можно предусмотреть несколько дизайнов страницы, применяемых в зависимости от характеристик устройства (размера и разрешения экрана), используемого для просмотра.

Веб-сайты и веб-страницы хранятся на так называемых вебсерверах — компьютерах, на которых установлено специальное программное обеспечение, обладающее соответствующим функционалом. Программа, позволяющая хранить и пересылать веб-страницы, также называется веб-сервером. Пользователи, имеющие доступ к сети, просматривают веб-документы при помощи программ-клиентов — веб-браузеров (рис. 4.1).

Взаимодействие клиент-сервер происходит по протоколу HTTP (англ. HyperText Transfer Protocol — протокол передачи гипертекста).

Интернет как глобальная информационная система

Рис. 4.1. Схема обработки запросов пользователя

Активные компоненты веб-страниц содержат программный код, позволяющий выполнять действия в соответствии с заложенной в них программой. Для написания таких программ используются языки веб-программирования. Один из них — JavaScript, позволяющий описывать правила, определяющие реагирование веб-страницы на действия пользователя. Эти правила представляются в форме вебсценариев (скриптов) — программ, записываемых непосредственно в html-код страниц или в отдельный файл.

Что касается языков веб-программирования в целом, то их можно разделить на две пересекающиеся группы: клиентские и серверные. Программы на клиентских языках выполняются на стороне пользователя, и результат их выполнения зависит от используемого браузера. Серверные языки программирования, соответственно, выполняются на стороне сервера. Получая запрос с адресом веб-документа от браузера, серверные программы связываются с базой данных. БД передаёт информацию о веб-странице скриптам сервера, и те, обработав её, отсылают для интерпретации браузеру клиента, который и выводит результат совместной работы на монитор.

16.2. Поиск информации в сети Интернет

Поиск нужного документа во Всемирной паутине может происходить разными способами:

• указанием адреса документа;
• путём использования поисковых систем.

Поисковая система — это программно-аппаратный комплекс, предназначенный для поиска информации во Всемирной паутине.

Поисковая машина — программная часть поисковой системы; комплекс программ, предназначенный для поиска информации.

Поисковые системы располагаются на специально выделенных компьютерах с мощными каналами связи. Ежеминутно они обслуживают огромное количество поисковых запросов клиентов.

По принципу действия различают несколько типов поисковых систем, а именно:

• поисковые каталоги, управляемые человеком;
• системы, использующие поисковых роботов;
• гибридные поисковые системы.

Поисковые каталоги (веб-каталоги или тематические каталоги) содержат базу данных ссылок на веб-сайты, распределённых по отдельным тематическим рубрикам. Такие каталоги заполняются специалистами вручную. Поиск в них осуществляется спуском по дереву каталога:

• определив тему, по которой будет выполняться поиск, пользователь выбирает соответствующую рубрику тематического каталога;
• прочитав описания ссылок на открывшейся странице, пользователь может перейти по ссылке, соответствующей его ожиданиям; если же нужных ссылок не обнаруживается, то можно уточнить тему и повторить поиск в этой же или другой поисковой службе.

В 1994 году Дэвид Фило и Джерри Янг из Стэнфордского университета (США) предприняли попытку упорядочить большое количество накопившихся у них ссылок на разнообразные информационные источники. Так появилась идея использования специализированной базы данных для эффективного поиска информации в сети. Очень скоро созданная ими система Yahoo! стала самым популярным и полным иерархическим предметно-ориентированным путеводителем по Интернету. В наши дни — это одна из наиболее известных поисковых систем.

Действие поисковых систем, использующих поисковых роботов, основано на постоянном, последовательном изучении всех страниц всех сайтов Всемирной паутины. Для каждого документа составляется его поисковый образ — набор ключевых слов, отражающих содержание этого документа. В связи с постоянным обновлением информации поисковые системы периодически возвращаются к ранее изученным страницам, чтобы обнаружить и зарегистрировать изменения.

Информация о ключевых словах исследованных таким образом страниц сохраняется в поисковой системе.

При поступлении запроса от пользователя поисковая система на основании имеющейся в ней информации формирует список страниц, соответствующих критериям поиска. Найденные документы, как правило, упорядочиваются в зависимости от местоположения ключевых слов (в заголовке, в начале текста), частоты их появления в тексте и других характеристик.

Различные поисковые системы, использующие поисковых роботов, имеют схожую структуру, включающую:

1) модуль индексирования, состоящий из трёх программ-роботов (Spider или «паук» — скачивает веб-страницы; Crawler или «путешествующий паук» — переходит по всем ссылкам, имеющимся на странице, и ищет новые документы, ещё не известные поисковой системе; Indexer или «робот-индексатор» — разбивает на фрагменты страницы, которые скачали «пауки», анализирует их и составляет некоторое описание этих страниц);
2) базу данных — хранилище представленных в определённом формате всех скачанных и обработанных модулем индексирования документов;
3) поисковый сервер — система выдачи результатов поиска, определяющая, какие страницы и в какой степени удовлетворяют запросу пользователя.

Поисковая система, получив запрос на поиск, анализирует ту информацию, которая была ею проиндексирована. С одной стороны, это позволяет существенно повысить скорость обработки поискового запроса. С другой стороны, результаты поиска нельзя считать полными, т. к. ни одна поисковая система не может загрузить в свою базу данных информацию обо всех без исключения ресурсах. Кроме того, результаты поиска могут быть отчасти устаревшими — ситуация в сети Интернет меняется быстрее, чем происходит обновление сведений в базах данных поисковых систем.

Гибридные поисковые системы сочетают в себе функции систем, управляемых человеком, и систем, использующих поисковых роботов.

Несмотря на общие принципы работы, поисковые системы различаются по таким характеристикам, как: язык запроса, зона поиска, глубина поиска внутри документа, метод упорядочивания информации и др. На данный момент самой популярной в мире поисковой системой является Google, а крупнейшей отечественной поисковой системой — Яндекс.

В большинстве поисковых систем реализовано три основных типа поиска:

1) поиск по любому из слов — результатом является огромный список всех страниц, содержащих хотя бы одно из ключевых слов; применяется, когда пользователь не уверен в ключевых словах;
2) поиск по всем словам — в этом режиме формируется список всех страниц, содержащих все ключевые слова в любом порядке;
3) поиск точно по фразе — в результате составляется список всех страниц, содержащих фразу, точно совпадающую с ключевой (знаки препинания игнорируются).

Чтобы поиск стал более продуктивным, во всех поисковых системах предусмотрены специальные языки формирования запросов со своим синтаксисом. Эти языки во многом похожи. Выяснить особенности определённого языка можно с помощью справочной системы, входящей в состав поисковой машины.

Найдите информацию о правилах формирования поисковых запросов в поисковых системах Яндекс и Google. Сравните их между собой. Укажите общее и различия.

Пример. В языке запросов некой поисковой машины для обозначения логической операции ИЛИ используется символ «|», а для логической операции И — символ «&». Известны запросы и количество найденных по ним страниц некоторого сегмента сети Интернет:

Интернет как глобальная информационная система

Чему равно х, если все запросы выполнялись практически одновременно, т. е. во время выполнения запросов набор страниц, содержащих все искомые слова, не изменился?

С подобными задачами вы встречались в курсе информатики основной школы и знаете, что их условие может быть представлено с помощью кругов Эйлера и записано на языке теории множеств.

Интернет как глобальная информационная система

Пусть Я, G и В — множества страниц, содержащих слова Яндекс, Google и Bing соответственно.

Тогда Я ? G — множество страниц, соответствующих запросу «Яндекс & Google», и его мощность равна 145 (тыс.):

|Я ? G| = 145.

Рассуждая аналогично, можем записать: |В ? G| = 580, |Я ? В ? G| = 85.

Требуется найти мощность множества (Я ?) ? G.

Преобразуем это выражение:

(Я ? В) ? G = (Я ? G) ? (В ? G).

В справедливости такого преобразования вы можете убедиться, изобразив левую и правую части равенства с помощью кругов Эйлера.

Согласно принципу включений-исключений, для двух множеств имеем: |Х ? У| = |Х| + |У| — |Х ? У|.

В нашем случае получаем:

|(Я ? G) и (В ? G)| = |Я ? G| + |B ? G| — |(Я ? G) ? (В ? G)| = |Я ? G| + |B ? G| — |Я ? G ? B| = 145 + 580 — 85 = 640.

Итак, x = 640.

Как бы точно ни был составлен пользователем запрос к информационной системе, только малая часть из полученных по этому запросу документов будет релевантной, т. е. соответствующей зафиксированной в запросе информационной потребности.

Полнота поиска — это отношение числа выданных релевантных документов к общему числу релевантных документов, имеющихся в базе данных поисковой системы. В идеале это число должно равняться 1; на практике может достигать значений 0,7-0,9.

Точность поиска — это отношение числа выданных релевантных документов к общему числу документов, выданных системой по данному запросу. Значение этого параметра колеблется от 0,1 до 1.

Полнота и точность определяют качество или эффективность поиска.

16.3. О достоверности информации, представленной на веб-ресурсах

Поиск информации в сети Интернет удобен и прост, а самое главное — он занимает гораздо меньше времени, чем поход в библиотеку или работа с другими источниками информации. Благодаря этому в наши дни Интернет является самым популярным источником информации: им пользуются не только рядовые граждане, но и учёные, бизнесмены, государственные служащие, специалисты разных областей и сфер деятельности для решения самого широкого круга профессиональных задач. И это при том, что Интернет является зоной свободного доступа, в которой абсолютно каждый может не только искать ту или иную информацию, но и размещать в ней всё, что сочтёт возможным. Эти данные никем не контролируются и не проверяются, а поэтому они могут быть недостоверными (содержать устаревшие данные, ошибочные или заведомо ложные утверждения) и субъективными (отражать личную точку зрения автора).

К данным, которые вы получили в результате поиска в Интернете, следует относиться критически и предпринимать шаги для того, чтобы убедиться в достоверности информации.

Рассмотрим некоторые способы проверки информации, полученной в результате поиска в сети Интернет.

1. Выяснение репутации сайта, на котором размещена информация, представляющая для вас интерес. Проверенные данные публикуют официальные сайты государственных, коммерческих, научных и других структур, являющиеся первоисточниками информации. Ответственность за любую опубликованную ими информацию несут ресурсы, имеющие свидетельство о регистрации средства массовой информации. Избегают недостоверной информации известные ресурсы, занимающие высокие места в соответствующих рейтингах. Представление о репутации сайта можно получить в том числе и по имеющимся в сети отзывам об этом ресурсе.

Если веб-сайт не обладает широкой известностью, то следует обратить внимание на следующие моменты:

• указано ли, для кого предназначен ресурс и какова цель его создания;
• насколько регулярно обновляются данные на веб-сайте; не устарела ли информация (узнать дату размещения материалов);
• не требуют ли разработчики веб-страницы ввода ваших личных данных.

2. Получение информации об авторе представляющего интерес материала. Следует убедиться, что на веб-странице приведены данные об авторе, в том числе описание его квалификации и контактная информация. Можно попытаться найти и ознакомиться с другими работами этого автора, комментариями и отзывами читателей на его работы.

3. Проверка фактического материала. Любые фактические и статистические данные имеют источник. Хорошо, если ссылки на авторитетные источники имеются на страницах заинтересовавшего вас сайта. Если таких ссылок нет, то данные можно выборочно сверить с официальными источниками самостоятельно. Если обнаружится, что какие-то данные не согласуются с данными официальных источников, то и остальному материалу также не стоит доверять. Хорошо, если данные подаются с разных точек зрения, если они согласуются с тем, что вы изучали в школе или узнали из других источников.

Необходимо чётко представлять себе, что именно вы ищете, и проверять все важные данные, найденные в Интернете. Если в результате поиска вы не нашли ни одного подходящего документа, нужно:

• проверить правильность написания ключевых слов;
• проверить правильность использования логических связок;
• подобрать более удачные синонимы;
• изменить логику запроса.


САМОЕ ГЛАВНОЕ

Веб-страница с точки зрения её разработчика — это файл, содержащий собственно текст, несущий определённую информацию для пользователя, и служебную информацию для браузера (тэги разметки) на языке HTML (англ. HyperText Markup Language — язык разметки гипертекста).

HTML — один из веб-стандартов, по которым разрабатываются сайты во всём мире. Ещё одним из таких стандартов является технология CSS (англ. Cascading Style Sheets — каскадные таблицы стилей) — формальный язык описания внешнего вида документа, составленного с использованием языка разметки. Технология CSS позволяет принципиально разделить содержание и представление документа: описание содержания и логической структуры веб-страницы производится с помощью HTML или других языков разметки, а описание внешнего вида веб-страницы производится с помощью CSS.

Веб-страницы предназначены для воспроизведения на самых разных экранах самых разных компьютеров. Поэтому они не имеют «жёсткого» форматирования. Оформление веб-страницы выполняется непосредственно во время её воспроизведения на компьютере клиента в соответствии с настройками используемого браузера.

Поисковая система — это программно-аппаратный комплекс, предназначенный для поиска информации во Всемирной паутине. Поисковая машина — программная часть поисковой системы; комплекс программ, предназначенный для поиска информации.

По принципу действия различают такие типы поисковых систем, как: поисковые каталоги, управляемые человеком; системы, использующие поисковых роботов; гибридные поисковые системы.

Необходимо чётко представлять себе, что именно вы ищете, и проверять все важные данные, найденные в Интернете. Основными способами проверки найденной информации являются: выяснение репутации сайта; получение информации об авторе материала; проверка фактического материала по данным из авторитетных источников.


Вопросы и задания

1. Что представляет собой веб-страница с точки зрения пользователя и с точки зрения её разработчика?

2. В чём, по вашему мнению, состоит одно из основных отличий веб-страницы от обычного текстового документа?

3. Кому принадлежит идея гипертекста? Подготовьте краткое сообщение на эту тему.

4. Назовите два основных веб-стандарта. Для чего предназначен каждый из них?

5. Какие способы поиска документа во Всемирной паутине вам известны?

6. Что такое поисковая система? Что такое поисковая машина?

7. Какие типы поисковых систем можно выделить в зависимости от принципа их действия?

8. Почему, если мы не можем найти что-либо в одной поисковой системе, имеет смысл поискать нужный материал в другой?

9. Может ли случиться так, что поисковая система найдёт документ, который не существует?

10. В таблице приведены запросы к поисковому серверу. Для обозначения логической операции ИЛИ в запросе используется символ «|», а для логической операции И — «&». Расположите номера запросов в порядке возрастания количества страниц, которые найдёт поисковый сервер по каждому запросу.

11. Известны запросы и количество найденных по ним страниц некоторого сегмента сети Интернет:

12. Зная, что такое точность информации, дайте определение парному понятию «информационный шум».

13. Зная, что такое полнота информации, дайте определение парному понятию «потери информации».

14. Какая информация называется релевантной? Как связаны полнота и точность с качеством (эффективностью) поиска?

15. Можно ли безоговорочно доверять такому популярному ресурсу, как Википедия?

16. Кто такие блогеры? Можно ли безоговорочно доверять публикуемой ими информации?

17. В чём суть основных способов проверки достоверности информации, найденной в сети Интернет?

18. Найдите в сети Интернет не менее трёх авторитетных источников, содержащих информацию по одной из следующих тем:


§ 15. Службы Интернета
§ 16. Интернет как глобальная информационная система
Глава 5. ОСНОВЫ СОЦИАЛЬНОЙ ИНФОРМАТИКИ
§ 17. Информационное общество