• История CAPTCHA началась с одного человека, мечтавшего изменить мир.
Луис фон Ан был молодым информатиком из Университета Карнеги в Меллоне,
который пытался решить проблему спама в интернете. Именно ему и его коллегам в
2000 году пришла в голову роковая идея под названием
"Completely Automated Public Turing test to tell Computers and Humans Apart" - собственно CAPTCHA. Принцип работы теста был прост - люди без нарушения зрения легко читали искаженные символы на экране, а вот у роботов с этим были явные проблемы.
• Незатейливое, но гениальное изобретение фон Ана сработало, распространилось и было готово прославить своего создателя! Однако, переложив страдания юзеров на математику, фон Ан с ужасном понял, что капча - настоящий
пожиратель времени. Каждый раз, когда вы ее вводите, вы тратите
10 драгоценных секунд. А если умножить это на
200 миллионов (число вводов капчи в день), то получается, что теряется больше
500 тысяч человеко-часов (или 57 лет) ежедневно!
• Ну да ладно... Спустя 7 лет появился новый проект -
reCAPTCHA, удвоив число слов в ней. В 2007 году фон Ан объединился с
The New York Times и
Internet Archive для перевода в цифру различной макулатуры. Эти проекты использовали программы оптического распознавания текста (OCR), у которых была та же слабость, что и у спам-программ: они
не считывали искаженные буквы. Угадайте, где еще искаженных, выцветших, изъеденных временем букв было пруд пруди? Верно - в старых книгах, газетах и журналах. В текстах старше полувека ошибки OCR достигали
30%, и перепроверять такие объемы вручную было бы (очень дорогим)
безумием.
• Луис фон Ан и его reCAPTCHA решили задачу элегантно. Новая капча показывала пользователю два слова: одно контрольное,
уже известное системе, и одно
новое - из скана книги или газеты. Если человек правильно вводил первое, компьютер полагал, что и второе, скорее всего, верно.
• Далее
вариант юзера сверяли с ответами других пользователей. Когда 10 человек расшифровывали
одно и то же слово одинаково, оно считалось
распознанным и само становилось первым контрольным словом.
• Люди так часто проходили капчу, что
годовой объем статей The New York Times расшифровывали каждые четыре дня. Всего
за несколько месяцев юзеры по всему миру оцифровали выпуски газеты New York Times за
двадцатилетний период! В течение только первого года эксперимента reCAPTCHA было расшифровано
440 миллионов слов, что эквивалентно
17 600 книгам.
• Подведя первые итоги, институт CyLab при Университете Карнеги в Меллоне, тот самый, в котором работала группа фон Ана, сообщил о
99,1% точности распознавания - результат, близкий к профессиональному в транскрибировании.
• В 2009 году проект reCAPTCHA купила
Google и с его помощью запустила уже Google Books - амбициозный проект по "оцифровке всех существующих книг". К 2019 году компании удалось с помощью reCAPTCHA отсканировать более
40 миллионов книг (около трети всего мирового фонда).
• Позже, конечно, ситуация изменилась - ИИ взламывает капчу, а Google заключает с юзерами сомнительную, с точки зрения приватности, сделку - начинает
собирать личные данные о поведении в сети в обмен на лаконичное тыканье в чекбокс «Я не робот». Так душа reCAPTCHA умрет. Но фон Ана это уже не будет волновать - ведь вдохновившись успехом в книжной оцифровке, он с головой погрузится в свой новый проект - Duolingo (та самая зеленая сова для изучения английского языка), но это уже совсем другая история...
S.E. ▪️
infosec.work ▪️ VT