Генерація відео із озвучкою, «міти» з перекладом в реальному часі та багато іншого. Що показали на Google I/O 2025

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Відео з озвучкою та звуками

Відбулося те, про що ми вже казали ще наприкінці минулого року — завершилася епоха «німого кіно» і ШІ-генератори тепер можуть додавати озвучку до відео.

«Вперше ми виходимо з епохи німого відео», — заявив Деміс Хасабіс, генеральний директор Google DeepMind.

Veo 3, який вийшов у реліз під час Google I/O 2025 охоплює і озвучування тексту, і звукові ефекти та навіть фон.

За словами розробників, якість відео також підросла порівняно із попередньою версією — Veo 2. Нова ітерація відеогенератора унікальна також тим, що розуміє сирі пікселі та завдяки цьому автоматично синхронізує необхідний звук із зображенням.

Veo 3 зараз вже доступна у Gemini — але лише для підписників плану AI Ultra вартістю $249.99 на місяць (це також нова фішечка від Google).

Синхронний переклад для відео-«мітів»

Друга "вау «новинка від Google — це можливість перекладати аудіо зберігаючи голос і інтонації співрозмовник в Google Meet. Це не субтитри чи щось подібне — це саме звуковий переклад із збереженням голосу та інтонації співрозмовника

Щось схоже вже існує в YouTube, але у «лайт» версії. Можливо, схожу технологію використають і для відеохостингу:

Deep Think від Google вийшла у топ по бенчмарках

Також на конференції Google анонсували новий інструмент Deep Think — для глибокого синтезу та аналізу. Представники компанії нечітко виразились щодо того, як працює технологія, але вона, імовірна подібна до OpenAI o1-pro та анонсованої o3-pro.

У цифрах: За допомогою Deep Think модель Gemini 2.5 Pro посіла перше місце в LiveCodeBench — це бенчмарк з програмування. Також їй вдалося обігнати OpenAI o3 у MMMU — тесті на навички сприйняття та міркувань. У тестах з математики все взагалі «супер».

DeepThink

Deep Think доступний лише для «надійних тестувальників» через Gemini API — у Google поки що утримуються від повного релізу, із безпекових міркувань. Що має сенс, у світлі останніх незмістовних безпекових звітів від OpenAI, Google та Meta.

Та багато іншого

Насправді на конференції представили ще мільйон додаткових «фішок»:

  • Stitch: інструментарій для створення UI — лише за текстовим описом (в автора він не працює((
  • Jules: Це агент-розробник. Працює з GitHub, виправляє баги, пише код і тести. Він може працювати у зв’язці із Stitch. Комфортно.
  • Project Mariner: ШІ-агент, який вміє взаємодіяти зі сторінками в інтернеті.
  • Gemini додали у Chrome: Це чисто ШІ-помічник для браузера. Чи потрібно це?..
  • А, ще є Imagen 4, який вміє у написи на картинках. І ще швидкий.
  • ...і купа всього на кшталт нових віртуальних окулярів, Project Beam для 3D-конференцій, нову оперативну систему для розумних годинників тощо.

В цілому конференція вийшла цікавою, але надто змістовною. Так багато продуктів, що і не розберешся 😅

А що думаєте ви? Чи будете користуватися новинками?

👍ПодобаєтьсяСподобалось4
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Синхронний переклад для відео-«мітів»
Друга "вау "новинка від Google — це можливість перекладати аудіо зберігаючи голос і інтонації співрозмовник в Google Meet. Це не субтитри чи щось подібне — це саме звуковий переклад із збереженням голосу та інтонації співрозмовника

Це певно найцікавіша функція, бо повністю стирає мовні бар’єри. Дуже очікую переклад з української.

Підписатись на коментарі