Google начали раскатывать Gemini в Chrome на всех - записал быстрый обзор
Сегодня открыл свой ноутбук и там меня ждало обновление, которого я очень ждал! Gemini в Chrome начала выходить из беты и это прямо прикольно. Сразу скажу, что в отличие от Comet и Genspark - это не агент, который может контролировать ваш компьютер и принимать решения за вас, но с точки зрения коллаборативной работы Gemini меня прямо порадовал.
Решил прямо сходу протестировать этот функционал, так еще и на русском (я не знал, ответит ли мне модель). К посту приложил запись экрана.
Задачку взял простую: у меня был открыт обзор велосипедного седла, я попросил Gemini помочь мне определиться, подходит ли мне это седло, а после - найти, где я могу его купить подешевле.
Коротко про результат
В целом, модель справилась неплохо с точки зрения анализа, и на троечку с точки зрения поиска информации. Думаю, связано это с тем, что в угоду работе в режиме реального времени, они используют легкую Flash модель. В результате, когда я попросил найти мне ссылки на магазины - она дала всего две ссылки на разные седла. Это были седла той же серии, на которую я смотрел обзор, но не прямо те же конкретные.
А как хотелось бы?
С точки зрения работы на результат, было бы круто, если бы они реализовали это в мультиагентном режиме. Условно: для базового общения с пользователем используется Gemini Flash, которая отвечает за речь и информирование пользователя о том, что происходит, а при детекции сложной задачи - она бы отдавала ее PRO с каким-то набором инструментов. При переключении на PRO было бы круто информировать пользователя о том, что выполняется действие (например, ведется поиск), а параллельно спрашивать, может ли ИИ чем-то еще помочь. В Comet это +- так реализовано, но там модель более глупая и в схожем сценарии завалила меня кучей лишних вопросов.
Итог и для чего может быть полезно сейчас
В общем, до прямо крутого AI браузинга нам еще далеко, но формат взаимодействия с AI именно голосом и с маленьким окошком мне кажется более нативным и удобным. Сейчас основной сценарий, который я вижу - голосовое взаимодействие и коллаборация по материалам на разных страницах, браузинг конкретных страниц без рук (например, пока готовишь - можно пообщаться с ИИ), анализ UI-интерфейсов (часто делал так анализ первичных прототипов).
В общем, пока польза очень специфическая, но когда Google добавят агента, это может быть уже интересно
Обсуждение 8
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram