Google DeepMind обучил Gemini понимать контекст движений курсора мыши
Источник: Google DeepMind
Команда Google DeepMind представила инновационную концепцию «ИИ-указателя», трансформирующую привычный курсор в мощный инструмент взаимодействия с искусственным интеллектом. Больше не нужно составлять сложные запросы: достаточно навести мышь на объект и дать лаконичную команду, например: «проанализируй», «сопоставь» или «перенеси это».
Разработчики отмечают, что парадигма управления компьютером оставалась практически неизменной на протяжении десятилетий, ограничиваясь лишь перемещением курсора по координатной сетке. DeepMind предлагает эволюционный скачок: наделить систему способностью осознавать не просто положение указателя, но и семантическое содержание того, что находится в фокусе внимания пользователя.
В основе разработки лежит идея контекстно-зависимого ИИ. Сейчас большинство нейросетевых инструментов изолированы от рабочей среды, что вынуждает пользователей постоянно копировать данные или вручную описывать контекст. Google стремится устранить этот разрыв, интегрируя ИИ непосредственно в пользовательский интерфейс.
Сценарии использования весьма разнообразны: от мгновенного создания диаграмм по данным из PDF-таблиц до автоматического пересчета пропорций в кулинарных рецептах или построения маршрутов прямо по фотографии объекта. Система самостоятельно определяет, какой контент выбран и какой тип обработки будет наиболее уместным.
Фундамент этой концепции составляют четыре столпа: устранение «переключательных барьеров» (необходимости уходить в чат-бот), глубокое визуальное понимание контекста, переход на естественный язык общения и наделение элементов интерфейса смысловой нагрузкой, превращая пиксели в объекты (даты, локации, документы), доступные для прямого взаимодействия с ИИ.
Фактически, Google стремится адаптировать под компьютерную среду естественную для человека модель коммуникации, сочетающую речь и жестовое управление. Современные мультимодальные модели, такие как Gemini, уже обладают необходимыми навыками, чтобы интерпретировать намерения пользователя, опираясь на визуальную и текстовую информацию.
Первые шаги уже сделаны: в браузере Chrome стала доступна интеграция с Gemini, позволяющая анализировать содержимое веб-страниц «на лету» — например, для сравнения товарных позиций или визуализации интерьерных решений.
Более того, анонсированная функция Magic Pointer для будущих ноутбуков Googlebook знаменует собой переход к устройствам, изначально спроектированным как площадка для бесшовного ИИ-ассистирования. Параллельно передовые наработки проходят проверку в рамках инициатив Google AI Studio и Google Labs Disco.
Речь идет о фундаментальной трансформации пользовательского опыта в эпоху генеративного интеллекта. Курсор перестает быть просто индикатором позиции, превращаясь в «лазерную указку» для ИИ-агента, способного считывать не только прямые указания, но и истинные намерения человека.
Источник: iXBT
Дата-центры SpaceX на орбите грозят появлением нового вида электронных отходов
Маск планирует свыше 30 запусков Starship в день, но признает: до масштабов авиации космонавтике еще далеко
Не постановка: глава ZQGame подтвердил, что сверхсильный робот T800 действительно отбросил своего создателя мощным пинком на несколько метров
Появились первые живые фото Vivo X500 Pro — будущего короля мобильной фотографии
Илон Маск рассказал, почему Grok Bot способен работать даже при выключенном компьютере
Роскосмос показал плато Маньпупунёр со спутника «Ресурс-П»
Анонсирован мобильный роутер ZTE U25: сменный аккумулятор, 8 часов автономности и подключение до 32 устройств
Раскрыты названия будущих 2-нм процессоров Qualcomm — Snapdragon 8 Elite Gen 6 и Snapdragon 8 Elite Extreme Gen 6