Gemini — семейство мультимодальных моделей Google DeepMind, представленное 6 декабря 2023 после слияния Google Brain и DeepMind. В отличие от GPT-4o модель обучена сразу на тексте, изображениях, аудио, видео и коде, а не адаптирована постфактум. Линейка делится на четыре версии: Nano работает локально на Pixel, Flash — быстрая и дешёвая ($0.075 за 1M input токенов), Pro держит контекст до 1-2 млн токенов, Ultra остаётся флагманом для reasoning-задач. В статье разбираем архитектуру на базе decoder-only трансформера, подключение через Gemini API и Google AI Studio, сравнение с GPT-4o и Claude, а также рабочие способы доступа из России — включая OpenRouter и ProxyAPI.
Что такое Gemini AI и кто стоит за проектом
Gemini — семейство мультимодальных моделей от Google DeepMind, подразделения, образованного 20 апреля 2023 после слияния Google Brain и DeepMind. Это объединение сняло внутреннюю конкуренцию двух исследовательских команд и позволило Google выпустить единую линейку моделей вместо параллельных проектов PaLM и Gopher.
Первая версия, Gemini 1.0, была представлена 6 декабря 2023 сразу в трёх размерах — Ultra, Pro и Nano. Ключевое отличие от GPT и Claude того времени: Gemini спроектирована как нативно мультимодальная модель, обученная одновременно на тексте, изображениях, аудио, видео и коде, а не дообученная поверх текстовой модели через отдельные энкодеры.
Технический отчёт по архитектуре появился на arXiv 19 декабря 2023 под номером 2312.11805 — там описаны детали обучения и бенчмарки. Уже в декабре 2023 Gemini Ultra первой среди LLM превысила порог 90% на MMLU, что на тот момент было заметным результатом.
За проектом стоит не только исследовательская команда, но и вся инфраструктура Google: интеграция в Search через AI Overviews (бывший SGE, запущен в мае 2024), в Workspace через подписку Gemini Advanced за $19.99/мес, и на устройствах — Gemini Nano работает локально на Pixel 8 Pro и Pixel 9 Pro через Android AICore, обеспечивая мультимодальность без обращения к облаку.
Для разработчиков доступ к моделям идёт через Google AI Studio и Vertex AI. Быстро протестировать API без сложной настройки можно через Google AI Studio, а для продакшна с оплатой в рублях без карты иностранного банка используют ProxyAPI или OpenRouter.
Далее разберём архитектуру трансформера, лежащую в основе всей линейки моделей.
Источник: https://blog.google/technology/ai/google-gemini-ai/
Архитектура Gemini: трансформер и мультимодальность
Gemini разрабатывает Google DeepMind — команда, образованная 20 апреля 2023 после слияния Google Brain и DeepMind. Первая версия Gemini 1.0 вышла 6 декабря 2023, а технический отчёт опубликовали 19 декабря 2023 на arXiv (2312.11805). В отличие от GPT и Claude, которые изначально текстовые модели с прикрученной мультимодальностью, Gemini обучалась нативно мультимодальной — сразу на тексте, изображениях, аудио, видео и коде. Это влияет на архитектуру: модель не конкатенирует эмбеддинги разных модальностей поверх текстового бэкбона, а обучается на смешанных последовательностях токенов с самого начала претрейна.
Decoder-only с вариативной плотностью
Базовая архитектура — decoder-only transformer, но с вариативной плотностью слоёв: разные версии модели (Nano, Flash, Pro, Ultra) используют разное количество активных параметров при общей архитектурной схеме. Это позволяет разворачивать Gemini Nano локально на Pixel 8 Pro через Android AICore, сохраняя совместимость с более крупными версиями по API.
Контекстное окно как архитектурная особенность
В феврале 2024 анонсировали расширение контекста Gemini 1.5 Pro до 1 000 000 токенов — на тот момент рекорд среди коммерческих LLM (128k у GPT-4o, 200k у Claude 3.5). С августа 2024 в экспериментальном режиме доступно окно 2M токенов. На практике это означает, что в один запрос помещается до 1 часа видео или 30 000 строк кода — без чанкинга и без промежуточного индекса. Такой объём контекста меняет подход к RAG: для небольших корпусов документов векторная БД становится избыточной, достаточно передать всё в промпт.
Мультимодальность и длинный контекст работают вместе: модель одновременно анализирует видеоряд, аудиотрек и субтитры в одном forward pass, что даёт state-of-the-art результат на бенчмарке VideoMME.
Для работы с этой архитектурой через API удобно использовать Vertex AI — там доступны все версии модели с единым эндпоинтом, совместимым по стилю с OpenAI API. Подробнее про доступ и лимиты — в разделе про подключение к API.
Семейство моделей: Nano, Flash, Pro и Ultra
После слияния Google Brain и DeepMind (20 апреля 2023) команда Google DeepMind собрала линейку Gemini под одну архитектуру, но с разной плотностью параметров. Первая версия Gemini 1.0 вышла 6 декабря 2023 сразу в трёх весах: Nano, Pro и Ultra. Все три обучены нативно мультимодально — на тексте, изображениях, аудио, видео и коде одновременно, без отдельных адаптеров под модальность.
Nano — на устройстве
Gemini Nano работает локально на Pixel 8 Pro через Android AICore, без обращения к облаку. Позже Pixel 9 Pro получил обновлённый Nano с мультимодальностью прямо на чипе — распознавание изображений и звука без сети. Это модель для latency-critical сценариев: автодополнение, суммаризация уведомлений, офлайн-ассистенты.
Pro — рабочая лошадка с длинным контекстом
Gemini 1.5 Pro — главный кандидат для продакшна. В феврале 2024 анонсировали расширение контекста до 1 000 000 токенов, а с августа 2024 в экспериментальном режиме доступно 2M токенов. Это перекрывает 128k у GPT-4o и 200k у Claude 3.5. На практике 1.5 Pro принимает до часа видео или 30 000 строк кода за один запрос и показывает state-of-the-art на VideoMME — бенчмарке понимания видео. При таком контексте RAG для небольших корпусов можно строить без векторной БД, просто заливая весь корпус в промпт — подробнее в разделе про (/rag-без-векторной-бд/).
Цена: $1.25 за 1M input и $5 за 1M output токенов до 128k, дальше дороже.
Flash — дешёвый и быстрый
Gemini 1.5 Flash выпущен в мае 2024 на Google I/O как облегчённая версия Pro для высоконагруженных сценариев. Цена — $0.075 и $0.30 за 1M токенов, один из самых дешёвых флагманов на рынке. 11 декабря 2024 анонсирован Gemini 2.0 Flash с поддержкой native tool use и вывода в реальном времени — прямое развитие направления, заданного на Google I/O 2024 прототипом Project Astra.
Ultra — топ по бенчмаркам Gemini Ultra в декабре 2023 первым среди LLM превысил 90% на MMLU. Технический отчёт с деталями архитектуры (decoder-only трансформер с вариативной плотностью) опубликован на arxiv 19 декабря 2023, arXiv 2312.11805.
Доступ из России Через pip install google-generativeai или REST-эндпоинт, совместимый с OpenAI-стилем на Vertex AI. Прямой доступ к Google AI Studio работает без VPN, но Paid Tier требует карту иностранного банка. Практичнее взять Gemini через OpenRouter с оплатой в крипте, либо российский ProxyAPI с оплатой в рублях.
Возможности Gemini: текст, код, видео, аудио
После слияния Google Brain и DeepMind (20 апреля 2023) новая команда Google DeepMind выпустила Gemini 1.0 6 декабря 2023 — модель, спроектированную как нативно мультимодальная с самого начала обучения, а не через дообучение текстовой LLM на других модальностях. Архитектурно это decoder-only трансформер с вариативной плотностью, детали описаны в техотчёте на arXiv 2312.11805 (опубликован 19 декабря 2023).
Главный практический скачок — контекстное окно. Gemini 1.5 Pro анонсировал расширение до 1 000 000 токенов в феврале 2024, а с августа 2024 в экспериментальном режиме доступны 2M токенов. Для сравнения: GPT-4o — 128k, Claude 3.5 — 200k. На таком окне модель принимает до часа видео или 30 000 строк кода в одном запросе, что делает Gemini лидером на бенчмарке VideoMME по пониманию видео.
Что реально можно кормить модели
- Текст, изображения, аудио, видео и код — в одном запросе без предобработки
- До 1 часа видео целиком, без нарезки на кадры вручную
- Большие кодовые базы: 30k строк как контекст для рефакторинга или code review
- Function calling (с мая 2024) для вызова внешних инструментов прямо из ответа модели
Большое окно контекста меняет подход к RAG: для небольших корпусов документов векторная БД становится избыточной — можно просто засунуть весь корпус в промпт. Это одна из причин, почему Gemini используется как primary LLM в LangChain и LlamaIndex.
Линейка моделей закрывает разные сценарии: Gemini Ultra в декабре 2023 первым среди LLM перешагнул 90% на MMLU, Gemini 1.5 Flash (май 2024, Google I/O) — дешёвый и быстрый вариант за $0.075/$0.30 за 1M токенов, а Gemini Nano работает локально на Pixel 8 Pro и Pixel 9 Pro через Android AICore без похода в облако.
Попробовать всё это быстрее через Google AI Studio — бесплатный tier даёт до 15 RPM и 1M TPM, хватает для прототипирования. Если нужен доступ без карты иностранного банка, есть OpenRouter с оплатой в крипте — там Pro и Flash доступны как единая модель через (/pillar/llm-api-роутеры/).
Gemini API: как подключить и сделать первый запрос
Установка SDK и первый запрос занимают буквально пару минут. Библиотека google-generativeai — официальный клиент Google для Python, есть также REST-эндпоинт и совместимый с OpenAI-стилем адаптер через Vertex AI.
pip install google-generativeai
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
model = genai.GenerativeModel("gemini-1.5-flash")
response = model.generate_content("Объясни async/await в Python на пальцах")
print(response.text)
API-ключ получаешь в Google AI Studio — он открывается по прямой ссылке без VPN, ключ создаётся в один клик. Для продакшна с оплатой в рублях используют ProxyAPI или OpenRouter.
Gemini в продуктах Google: Search, Workspace, Pixel
Gemini — не просто API, это ядро, встроенное в половину продуктов Google. Разберём, где именно.
Search: AI Overviews
В мае 2024 Google запустил AI Overviews (бывший SGE, Search Generative Experience) прямо в поисковой выдаче на базе Gemini. Модель читает топ-результаты и генерирует краткую сводку сверху страницы — до того, как пользователь откроет ссылки. Для SEO и контент-стратегий это ощутимо снижает CTR на органику, поэтому если ты работаешь с трафиком — это стоит учитывать.
Workspace: Gemini Advanced
Подписка Gemini Advanced стоит $19.99 в месяц и даёт доступ к модели прямо в Gmail, Docs, Sheets, Slides. Она умеет суммировать переписку, писать черновики писем по контексту треда, генерировать таблицы из текстовых описаний. По сути это Copilot-аналог от Google, только завязанный на Gemini 1.5 Pro с его контекстом до 1 000 000 токенов — можно закинуть весь тред обсуждения или объёмный документ целиком без нарезки на чанки.
Pixel: Gemini Nano на устройстве
На Pixel 8 Pro Gemini Nano работает локально через Android AICore — без похода в облако, с низкой задержкой и офлайн-режимом. Pixel 9 Pro пошёл дальше: получил мультимодальную версию Nano, которая обрабатывает изображения и текст прямо на чипе. Это отдельная ветка модели, оптимизированная под мобильное железо, а не урезанная копия Gemini 1.5 Pro.
Если хочешь то же самое через API
Если задача — не подписка на готовый продукт, а встраивание тех же возможностей в свой пайплайн, доступ к той же линейке моделей проще получить через Google AI Studio — там бесплатный tier с лимитом 15 RPM и 1M TPM на 2024 год, либо через Vertex AI для продакшена с SLA. Для сравнения архитектур с конкурентами — дальше по тексту.
Gemini vs GPT-4o vs Claude vs Llama: что выбирать в 2024–2025
Главное отличие Gemini 1.5 Pro от конкурентов — размер контекстного окна. Против 128k токенов у GPT-4o и 200k у Claude 3.5 Sonnet, Gemini даёт 1M токенов в стабильном режиме и 2M в экспериментальном (с августа 2024). Это меняет подход к RAG: с миллионом токенов контекста для небольших корпусов документов векторная БД просто не нужна — засовываешь весь корпус в промпт и работаешь напрямую.
По цене расклад такой:
| Модель | Input $/1M | Output $/1M | Контекст |
|---|---|---|---|
| Gemini 1.5 Pro | $1.25 | $5.00 | 1M–2M |
| Gemini 1.5 Flash | $0.075 | $0.30 | 1M |
| GPT-4o | ~$2.50 | ~$10.00 | 128k |
| Claude 3.5 Sonnet | ~$3.00 | ~$15.00 | 200k |
Gemini 1.5 Flash — один из самых дешёвых флагманов на рынке, что делает его выбором по умолчанию для массовых задач вроде классификации или суммаризации, где не нужна максимальная точность.
В бенчмарках Gemini Ultra в декабре 2023 первым среди LLM превысил 90% на MMLU, а Gemini 1.5 Pro держит state-of-the-art на VideoMME — бенчмарке понимания видео, что логично: модель нативно мультимодальна и принимает до часа видео или 30 000 строк кода за один запрос. GPT-4o и Claude работают с изображениями и аудио, но не с видео как с полноценной входной модальностью.
Llama (открытые веса Meta) конкурирует в другой категории — она не привязана к облаку и подходит, когда важен self-hosting и контроль данных, но по контексту и мультимодальности отстаёт от Gemini 1.5.
Для продакшена важна совместимость: Gemini API поддерживает function calling с мая 2024 и REST-эндпоинт в стиле OpenAI через Vertex AI, так что миграция кода между провайдерами минимальна. Gemini уже встроен как primary LLM в LangChain и LlamaIndex.
Если работаешь с несколькими моделями одновременно и хочешь единый биллинг без карты иностранного банка, разумно смотреть на агрегаторы вроде OpenRouter — там Gemini 1.5 Pro и Flash доступны как единая модель с оплатой в USDT. Для прямого доступа к Google без агрегатора остаётся Google AI Studio, но Paid Tier там всё равно требует карту иностранного банка. Про варианты оплаты из России — в следующем разделе.
Как использовать Gemini AI из России
Google AI Studio открывается по прямой ссылке без VPN, бесплатный API-ключ выдаётся в один клик. Проблема возникает только на этапе оплаты Paid Tier — для этого требуется карта иностранного банка. Рабочие варианты:
- OpenRouter — единая модель
Gemini 1.5 Pro / Flashс оплатой в USDT/крипте. Подходит, если уже работаешь с несколькими LLM через OpenRouter и хочешь единый биллинг. - ProxyAPI — российский посредник с оплатой в рублях, юридическими документами и API-совместимым доступом. Хорош для компаний с бюджетированием в RUB.
- Vertex AI через партнёров — если нужны enterprise-SLA и контракт с Google через реселлера.
pip install google-generativeai
После установки SDK экспортируешь ключ от выбранного провайдера и работаешь как с обычным Gemini API. Для OpenRouter меняется только base_url и заголовок авторизации, остальной код остаётся без изменений.
Практические кейсы: где Gemini работает лучше всего
Огромное окно контекста и мультимодальность решают конкретные задачи, где другие модели упираются в лимиты.
Анализ длинных документов и видео
Gemini 1.5 Pro принимает до 1 часа видео или 30 000 строк кода в одном запросе — можно закинуть весь репозиторий и попросить найти баг без разбивки на чанки. На бенчмарке VideoMME (понимание видео) модель показывает state-of-the-art результат, что делает её выбором номер один для задач видео-аналитики: разметка сцен, генерация субтитров, поиск моментов по описанию.
RAG без векторной базы
Для небольших корпусов (до пары сотен страниц) контекст 1M токенов убирает необходимость строить RAG с векторной БД — просто передаёшь весь корпус в промпт. Это упрощает пайплайны на LangChain и LlamaIndex, где Gemini уже используется как primary LLM. Экспериментальный режим с окном 2M токенов (с августа 2024) расширяет это до целых кодовых баз или юридических архивов.
Function calling и агенты
С мая 2024 Gemini API поддерживает function calling, а Gemini 2.0 добавляет native tool use и вывод в реальном времени — это основа для агентных пайплайнов, где модель сама решает, когда вызвать инструмент. Подробнее о построении таких цепочек — в разделе про (/ai-agents/tool-use/).
Бюджетные сценарии
Gemini 1.5 Flash при цене $0.075 / $0.30 за 1M токенов — один из самых дешёвых флагманов на рынке, подходит для массовой обработки текста: классификация, суммаризация, извлечение сущностей на больших объёмах.
Как тестировать без барьеров
Для быстрого прототипирования удобен Google AI Studio через OpenRouter — единая модель Gemini 1.5 Pro/Flash с оплатой в USDT без карты иностранного банка. Для продакшена с оплатой в рублях подойдёт ProxyAPI, а для энтерпрайза с SLA — партнёрский доступ через Vertex AI.
Выбор инструмента зависит от объёма: разовые эксперименты — Google AI Studio, стабильный поток запросов — Vertex AI или ProxyAPI.
Ограничения, безопасность и критика Gemini: чего ждать не стоит
Gemini — не идеальная модель, и репутация у неё неоднородная. В феврале 2024 модель отказалась генерировать изображения исторических личностей определённых рас и была временно отключена из-за over-correction в фильтрах безопасности. Это показало главную проблему RLHF-выравнивания у Google: чрезмерная осторожность ломает полезность модели для нейтральных задач.
Есть и технические ограничения. Free Tier в Google AI Studio держит жёсткий rate limit: 15 RPM, 1M TPM, 1500 RPD по данным на 2024 год — для продакшена этого мало, нужен Paid Tier или прокси-сервис вроде ProxyAPI с оплатой в рублях. Важный момент про приватность: данные, отправленные в Free Tier, могут использоваться Google для улучшения модели — opt-in нужно отключать вручную в настройках, иначе твои промпты и код утекают в обучающую выборку.
Критика касается и цены на длинный контекст: Gemini 1.5 Pro при запросах свыше 128k токенов дорожает заметно, и разработчики жалуются, что реальная стоимость RAG-пайплайна с 1M контекстом растёт нелинейно. Плюс доступ из России нетривиален — Google AI Studio открывается без VPN, но оплата Paid Tier требует карту иностранного банка, поэтому многие уходят на OpenRouter с оплатой в USDT или через Vertex AI-партнёров.
Есть и вопросы к бенчмаркам: высокие цифры на MMLU и VideoMME не всегда переносятся на реальные бизнес-задачи, особенно там, где нужна строгая структура вывода без function calling. Сравнение с (/pillar/gpt-4o/) и (/pillar/claude-3-5/) показывает, что у каждой модели свои слабые места — Gemini не исключение. Разработчику стоит тестировать на своих данных, а не доверять только маркетинговым цифрам от Google DeepMind.
Что дальше: roadmap Gemini 2.0 и будущее Gemini
11 декабря 2024 Google анонсировал Gemini 2.0 Flash — модель с нативным tool use и выводом в реальном времени, без промежуточных вызовов оркестратора. Это прямое развитие направления, заданного Project Astra, показанного на Google I/O 2024 как прототип универсального мультимодального ассистента: видит, слышит, отвечает с минимальной задержкой, помнит контекст диалога через сессию.
Gemini Google DeepMind двигается по трём осям: контекст, скорость, агентность. Контекст уже дошёл до 2M токенов в экспериментальном режиме — следующий шаг, судя по анонсам, это не увеличение окна, а его эффективное использование: кеширование контекста, инкрементальная индексация, снижение цены за токен при длинном вводе. Gemini 1.5 Flash с ценой $0.075/$0.30 за 1M токенов задаёт вектор — будущие версии, вероятно, будут ещё дешевле при сопоставимом качестве.
Агентность — второе направление. Native tool use в Gemini 2.0 означает, что модель сама решает, когда вызывать функцию, без явного prompt-инжиниринга под function calling. Это напрямую влияет на архитектуру пайплайнов в (/llm-agents/) и на то, как ты проектируешь оркестрацию в LangChain или LlamaIndex.
Что делать инженеру сейчас
- Тестировать
Gemini 2.0 Flashчерез Google AI Studio — доступ бесплатный, лимиты Free Tier уже описаны выше - Для продакшена с картой РФ смотреть
ProxyAPIилиOpenRouter - Для интеграции с корпоративным биллингом —
Vertex AIчерез партнёрскую программу
Roadmap Google явно указывает на слияние Search, Workspace и Android AICore в единую экосистему на базе Gemini — конкуренция с GPT-4o и Claude будет решаться не только качеством модели, но и скоростью выката агентных фич.
Заключение
Дальше — практика: зарегистрируйте ключ в Google AI Studio, протестируйте Gemini 1.5 Flash на реальной задаче с длинным контекстом и сравните latency с GPT-4o на своём датасете. Следите за roadmap Gemini 2.0 — native tool use и Project Astra уже меняют архитектуру агентов. Если работаете из России, сразу настройте оплату через ProxyAPI или OpenRouter, чтобы не терять время на карточные проблемы.
Часто задаваемые вопросы
сколько стоит Gemini 1.5 Pro за токен
Gemini 1.5 Pro стоит $1.25 за 1M входных токенов и $5 за 1M выходных при контексте до 128k. При превышении 128k тариф растёт. Gemini 1.5 Flash значительно дешевле — $0.075 и $0.30 за 1M токенов, что делает его одним из самых экономичных флагманов на рынке.
как оплатить Gemini API из России
Прямого способа оплатить Google Paid Tier из РФ картой российского банка нет — нужна карта иностранного банка. Рабочие варианты: OpenRouter с оплатой в USDT/крипте, где Gemini 1.5 Pro и Flash доступны как единая модель, либо ProxyAPI — российский посредник с оплатой в рублях и API-совместимым доступом.
чем Gemini лучше GPT-4o и Claude
Главное отличие — контекстное окно: 1M-2M токенов у Gemini 1.5 Pro против 128k у GPT-4o и 200k у Claude 3.5. Это критично для RAG без векторной БД и обработки видео/кода целиком. Gemini также лидирует на VideoMME. GPT-4o и Claude пока сильнее в отдельных бенчмарках рассуждений и кода.
какие лимиты у бесплатного Gemini API
Free Tier Google AI Studio на 2024-2025: 15 запросов в минуту, 1M токенов в минуту, 1500 запросов в день. Важно: данные из Free Tier могут использоваться Google для улучшения модели, если явно не отключить opt-in в настройках проекта.
можно ли использовать Gemini без VPN
Google AI Studio открывается по прямой ссылке без VPN и позволяет получить бесплатный API-ключ. Проблема возникает только на этапе оплаты Paid Tier — для этого требуется карта иностранного банка. Для обхода используют OpenRouter или ProxyAPI.
работает ли Gemini в LangChain и LlamaIndex
Да, Gemini интегрирован как primary LLM в LangChain и LlamaIndex через официальные коннекторы google-generativeai и Vertex AI. Это позволяет строить RAG-пайплайны и агентов, используя длинный контекст модели вместо традиционной векторной БД для небольших корпусов документов.