Google описала три новые аудиомодели Gemini
По описанию видео на официальном канале Google for Developers, на мероприятии Gemini Audio at Night представили три новые модели для синтеза речи, перевода и мультимодальных приложений.
Официальные материалы организации, которые AI Хроника пересказал по первоисточнику. Опубликовано: 6.
По описанию видео на официальном канале Google for Developers, на мероприятии Gemini Audio at Night представили три новые модели для синтеза речи, перевода и мультимодальных приложений.
По описанию видео на официальном канале Google for Developers, EmbeddingGemma 2 объединяет текст, изображения, видео и аудио в едином пространстве эмбеддингов и рассчитана на работу непосредственно на устройстве.
Google Research опубликовала отчёт о проблемах приватности и безопасности автономных агентов. Авторы предлагают оценивать уместность действий с учётом контекста, социальных норм и конкретного потока данных.
Google разместила на Hugging Face модель DiarizationLM-Gemma-4-E4B-v1. В её карточке есть теги, связанные с распознаванием речи и разделением аудио по говорящим, а также инструкции для запуска.
Google Cloud представила в режиме preview удалённый MCP-сервер для командной строки. Он предназначен для ИИ-агентов, которым требуется безопасный доступ к операциям с облачной инфраструктурой и BigQuery.
Google Research описала Diffusion Controller — лёгкую управляющую сеть для повышения соответствия изображений текстовым запросам. По данным компании, полностью разблокированная версия получила 90% побед над базовой моделью.