← Все статьи
Новости16 мин чтения

«open ai fm»: тихий запуск gpt-realtime-translate - потоковый перевод речи на 70+ языках

«open ai fm» - это демо синтеза речи, а не переводчик. Реальная новость - gpt-realtime-translate: потоковый перевод речи с 70+ языков за $0.034 в минуту. Цены, языки, независимый бенчмарк и подключение из России.

Обложка статьи: «open ai fm»: тихий запуск gpt-realtime-translate - потоковый перевод речи на 70+ языках

Человек набирает в поиске «open ai fm», потому что услышал: у OpenAI вышла какая-то аудио-штука, она вроде бы переводит голос. Правда состоит из двух половинок. Первая: openai.fm существует, но это витрина синтеза речи - она читает текст голосом и не переводит ничего. Вторая: живой перевод у OpenAI действительно есть. Модель gpt-realtime-translate вышла 7 мая 2026 года тихо, одним девелоперским постом, без презентации.

Цена вопроса смешная: $0.034 за минуту аудио по официальному анонсу, примерно 2.54 ₽ по курсу ЦБ РФ на 08.05.2026. Дорого обходится другое - разобраться, где у модели слабые места и как подключить её из России к своему продукту. Для прямого подключения заранее проверь доступные для твоего аккаунта способы биллинга. Рабочих путей три - зарубежная карта, посредники с наценкой и агрегаторы вроде provod.ai, где те же модели доступны в рублях по официальным тарифам. Дальше - по порядку, с ценами на июль 2026.

Платите в рублях за GPT API без наценки на токены через provod.ai

«open ai fm» - это что вообще?

Коротко: это официальное интерактивное демо TTS-модели gpt-4o-mini-tts. OpenAI запустила его примерно 20 марта 2025 года вместе с моделями транскрипции gpt-4o-transcribe и gpt-4o-mini-transcribe. Демо превращает текст в речь - и только.

Внутри 13 встроенных голосов, от alloy до marin и cedar (OpenAI рекомендует последние два), а манера речи задаётся текстовой инструкцией вида «говори как...». Код демо открыт и лежит на GitHub в репозитории openai/openai-fm. По смыслу это витрина синтеза: текст внутрь, голос наружу, никакого перевода.

Буквы fm и сбивают людей: слово звучит как радио, поэтому выдача подмешивает музыкальные сервисы. Этот шум разберём в конце отдельной рубрикой. А пока - новость, ради которой ты сюда и пришёл.

Что OpenAI тихо запустила 7 мая 2026 года?

Коротко: сразу три realtime-аудиомодели и перевод Realtime API из беты в общедоступность. GPT-Realtime-2 - голосовая модель с рассуждениями уровня GPT-5, GPT-Realtime-Translate - живой перевод, GPT-Realtime-Whisper - потоковая транскрипция.

«Тихо» - не метафора. Ни ивента, ни презентации: один пост в девелоперском блоге OpenAI. На vc.ru тогда отметили, что в самом релизе даже списка языков переводчика не было - он нашёлся позже в OpenAI Cookbook. В мае новость прошла почти незамеченной, а интерес к ней вернулся в июле, когда OpenAI дала перевод обычным пользователям ChatGPT. Об этом ниже.

Как устроена сессия gpt-realtime-translate?

Коротко: это потоковая модель speech-to-speech. Она переводит устную речь с 70 с лишним входных языков на 13 выходных «в темпе говорящего», не дожидаясь конца фразы. Вся сессия живёт в spoken контуре: микрофон внутрь, динамик наружу.

У переводчика отдельный эндпоинт /v1/realtime/translations (WebSocket wss://api.openai.com/v1/realtime/translations) и свой тип сессии - translation. Язык источника модель определяет сама, целевой ты задаёшь параметром. Звук гоняется сырым PCM (24 kHz PCM16) чанками. На выходе сразу три потока: переведённое аудио, транскрипт оригинала и транскрипт перевода - синхронно с речью.

Режим намеренно урезан: текстовый вход отключён, системные инструкции и вызов инструментов не работают. По данным OpenAI, модель обучали на тысячах часов записей профессиональных синхронных переводчиков, с пост-тренингом в духе RLHF, но под роль строгого интерпретатора. Машинный перевод прошёл путь от систем на LSTM до такого end-to-end контура, где одна модель делает всё сразу.

Заявленные сценарии в релизе - поддержка клиентов, трансграничные продажи, образование, мероприятия, медиа и креаторы. Представь перевод объявления в реве аэропорта, где каскад «распознать, перевести, озвучить» не успевает за говорящим. Среди задокументированных пользователей - Deutsche Telekom, Vimeo и BolnaAI.

Сколько стоит минута и какие языки в списке?

Коротко: $0.034 за минуту аудио, тарификация за длительность, а не за токены. По курсу ЦБ РФ 74.6209 ₽ за доллар на 08.05.2026 это примерно 2.54 ₽ за минуту; час двустороннего разговора обходится в $2.04, то есть около 152 ₽. Цена не менялась и в июльском апдейте - актуально на июль 2026.

Что считаемЦена по официальному анонсу OpenAIВ рублях по курсу ЦБ 08.05.2026
Классический Whisper (файл на транскрипцию)$0.006/мин≈0.45 ₽
GPT-Realtime-Whisper (потоковая транскрипция)$0.017/мин≈1.27 ₽
GPT-Realtime-Translate (живой перевод)$0.034/мин≈2.54 ₽
GPT-Realtime-2 (голосовой агент)$32 за 1M входных аудиотокенов, $64 за 1M выходных-

Из языковой математики важна асимметрия: на вход - 70 с лишним языков с автоопределением, на выход - только 13. Документированный список выходных: английский, испанский, португальский, французский, немецкий, итальянский, русский, китайский, японский, корейский, хинди, индонезийский и вьетнамский. Русский в списке есть.

Техническая рамка из карточки модели: контекстное окно 16 000 токенов, максимум 2 000 на выход, knowledge cutoff 30.09.2024. Бесплатного тира API нет: Tier 1 даёт 50 минут аудио в минуту, Tier 4 - 650. Модель развёрнута и в Azure AI Foundry со статусом GA (июнь 2026), но спеки листинга Azure расходятся с карточкой OpenAI - ориентируйся на цифры OpenAI.

Насколько это хорошо: независимый замер

Коротко: рекордная скорость, посредственный смысл. В бенчмарке LiveLingo Research (замер 10.06.2026; 120 реплик, пары английский→испанский/китайский/японский/немецкий, три клипа VOA) gpt-realtime-translate выдал первый переведённый звук быстрее всех - медианно за 711 мс. А по понятности перевода оказался последним из шести систем - 4.53 из 5.

СистемаПонятность перевода, 0-5
LiveLingo4.96
Gemini 3.5 Live Translate4.93
Google STT + Translate4.77
Azure4.65
DIY Whisper + GPT-4o-mini4.63
gpt-realtime-translate4.53

Типовые ошибки из отчёта: лишние вставки, инверсии смысла, подмена имён собственных. На плотной непрерывной речи перевод ещё и отстаёт: медиана задержки 3.8 секунды, дрейф до 20.3. У Gemini 3.5 Live Translate первый звук занимает около 2947 мс - вчетверо дольше, зато смысл держит ровнее.

У OpenAI своя статистика: по словам Пратика Сачана, сооснователя и CTO BolnaAI, на хинди, тамильском и телугу модель показала на 12.5% меньше ошибок распознавания (Word Error Rate), чем любая другая протестированная. Это данные вендора и его партнёра - относись к ним как к заявлению. Независимый замер говорит другое: скорость первого звука и точность смысла живут по разные стороны.

Бенчмарк LiveLingo: понятность перевода шести систем, gpt-realtime-translate последний по смыслу при лучшей скорости первого звука

Что изменилось в июле 2026?

Коротко: OpenAI дала перевод обычным пользователям ChatGPT - и этим усилила интерес к API-модели. 8 июля вышел GPT-Live (модели GPT-Live-1 и GPT-Live-1 mini): full-duplex голосовой режим, который слушает и говорит одновременно и переводит «по промпту». Скажи «переводи всё, что я говорю, на испанский» - и он будет.

У GPT-Live нет API, список языков не опубликован; TechCrunch в пресс-демо отметил у хинди-перевода сильный американский акцент и книжный тон. Днём раньше, 7 июля, в Realtime API добавили GPT-Realtime-2.1-mini - рассуждения и tool use в mini-тире по $0.60/$2.40 за миллион токенов, а улучшенное кеширование снизило p95-латентность минимум на 25% по всем realtime-моделям. Вывод недели: потребителям дали перевод в чате, а разработчику по-прежнему нужен gpt-realtime-translate.

Чего gpt-realtime-translate не решает?

Коротко: это узкий инструмент с жёсткой рамкой. Только аудио на вход, только 13 языков на выход, никакой настройки поведения. Всё, что за пределами рамки, - уже не про него.

  • Выходных языков 13. Нужен узбекский, казахский или армянский на выход - мимо, хотя на вход модель поймёт больше семидесяти.
  • Текстовый вход, системные промпты и вызов инструментов отключены; function calling и fine-tuning не поддерживаются. Никакого дообучения под твой домен - ни полного, ни экономного вроде QLoRA. Терминологию придётся беречь иначе, например постобработкой транскрипта.
  • Клонирование голоса - другая задача: нужен перевод голосом конкретного спикера - это территория инструментов класса SoVITS. Выбор голоса в переводной сессии не документирован как полноценная функция: вторичные источники противоречат друг другу, проверить не удалось.
  • Модерация встроена в сам API: классификаторы могут прервать сессию на ходу за нарушение политики, а разработчик обязан явно показывать пользователю, что тот общается с ИИ. Для чувствительных переговоров это ограничение, а не формальность.
  • Локально такую модель не поднять: весов в открытом доступе нет. Если ты из мира локального инференса - openvino, vulkan, lmcache, ncmoe, mtmd, params и прочие флаги вокруг llama.cpp - здесь они бесполезны.
  • Цифры про «задержку полсекунды-секунду» из вторичных обзоров не подтвердились: замер показывает медиану отставания 3.8 секунды на плотной речи.

Как подключить живой перевод из России?

Коротко: совместимость нужно проверять у конкретного провайдера: gpt-realtime-translate использует отдельный WebSocket-эндпоинт и сессию translation, поэтому могут потребоваться изменения в подключении и коде. Прямой биллинг OpenAI для российского юрлица закрыт, поэтому рабочая схема идёт через агрегатора.

  1. Заведи API-ключ у провайдера с OpenAI-совместимым доступом и рублёвым биллингом.

  2. Поменяй две строки в конфиге клиента - ключ и base_url:

    from openai import OpenAI

    client = OpenAI( api_key="PROVOD_API_KEY", base_url="https://api.provod.ai/v1", ) # дальше код как для OpenAI Realtime API: WebSocket-сессия # типа "translation", параметр output_language, аудио PCM 24 kHz

  3. Подними сессию перевода и гоняй звук чанками; принимай аудио и оба транскрипта.

  4. Перед продакшеном прогони свои языковые пары и фоновые шумы - бенчмарк выше показывает, что качество смысла гуляет.

Клиентская сторона не привязана к вендору: Open WebUI (в поисковых запросах - openwebui), совместимые IDE, боты и автоматизации подхватывают такой endpoint без переписывания кода. Из российских сервисов рядом по смыслу стоит Yandex SpeechKit, но это распознавание и синтез речи, а не живой перевод speech-to-speech: каскад «распознал - перевёл - озвучил» придётся собирать вручную, со своей суммарной задержкой.

Здесь и ложится provod.ai (российский OpenRouter): единый API, совместимый с OpenAI и Anthropic SDK, один рублёвый баланс на команду, оплата картой РФ, СБП или по счёту с закрывающими, цены без наценки к официальным тарифам. Новые востребованные модели добавляются в каталог максимально быстро - когда gpt-realtime-translate там появится, подключение будет ровно тем, что в листинге выше.

Когда provod.ai не подходит

Коротко: есть сценарии, где агрегатор лишний. Вот честный список.

  • Тебе достаточно перевода внутри ChatGPT. GPT-Live переводит голосом по промпту прямо в приложении - там не нужен ни API, ни код, ни сторонний сервис.
  • Тебе нужен закрытый контур. Агрегатор - про облачный API; если политика безопасности требует on-prem и свои GPU, ищите self-hosted решения, их здесь нет.
  • Тебе нужен прямой Enterprise-контракт с OpenAI. Свой SLA и персональные условия берутся только напрямую у вендора.
  • Тебе нужна свежая модель в день её выхода. Новые модели добавляются в каталог быстро, но не мгновенно; если ждать нельзя - придётся идти напрямую с зарубежной картой.

Словарик запросов кластера: что ещё люди гуглят рядом с «open ai fm»

Коротко: рядом с этой темой в поиске живёт целый зоопарк. Разбираем по группам, что вы могли иметь в виду.

Опечатки, раскладка и «как скачать»

  • «hpt» - «open ai chat hpt»: опечатка в ChatGPT.
  • «kompyuter» - «chatgpt skachat kompyuter»: скачивать нечего, всё в браузере и API.
  • «qilish» - то же «скачать» по-узбекски.
  • «уеуоа» и «роиеа» - абракадабра из чужой раскладки в поиске бесплатных генераторов.
  • «мирджони» - транслит без значения; искали бесплатную нейросеть.
  • «ojol» - «open ojol ai»: опечатка, продукта нет.
  • «хей» - «хей бро, нейросеть»: обращение, не название.
  • «ыр» - обрывок казахского музыкального запроса.

Сторонние сервисы и файлы

  • «cex» - криптобиржа CEX, смешалась с ботами для картинок.
  • «zeta» - сторонний «zeta ai bot», не OpenAI.
  • «razdevator» и «sovetnik» - сомнительные сайты «бесплатных нейросетей».
  • «textplus» - виртуальные номера, не нейросеть.
  • «sculptok» - малоизвестный 3D-генератор.
  • «toppal» - охота за бесплатной лицензией сервиса.
  • «sls» и «schoolboy» - коды и чужой пароль из экосистемы Runway; так делать не стоит.
  • «photogrid» и «photolab» - фоторедакторы с нейрофильтрами.
  • «vizai» и «pro100» - плагин к мебельному CAD pro100.
  • «cdr» - конвертация CorelDRAW: «ai» там - формат файла.
  • «1920х1080» - обои под размер экрана.

Фамилии и имена

  • «hands» - «open hands ai» это OpenHands, кодинговый агент.
  • «karparov» - фамилия из запросов про «skills» для Claude.
  • «rustam» - «gillman rustam gemini»: искали автора.
  • «зубченко», «исаченко» и «ятленко» - фигуры ИИ-курсов; ищут отзывы.

Музыка: «fm» тянет за собой радио

  • «suno fm» и само «fm» - музыкальный сервис Suno и радиоэфир; буквы совпали, смысл нет.
  • «любэ», «нэнси», «буратино», «четырка» и «вертолет» - запросы вида «Алиса, включи музыку» с названиями групп и песен.
  • «итало» - «итало-диско ремикс нейросетью»; «прорвемся» - песня у Алисы; «самопроизвольно» - жалоба, что Алиса сама включает музыку.
  • «бмв» - музыка «как из рекламы БМВ»; бренд тут случайный.
  • «tbox» и «tuvio» - голосовой помощник и пульт для ТВ с Алисой.
  • «дрд» - «озвучка дрд 1»: запрос про дубляж сериала.
  • «рингионы2026» - рингтоны на звонок, в запросе с опечаткой.
  • «techno» и «mixgen» - генерация треков.
  • «souls» и «cry» - группа Souls Cry; спрашивают, нейросеть ли это.
  • «ohnuma» и «celtic» - трек «ai ohnuma celtic scene», ищут скачать бесплатно.

Бренды, устройства и аббревиатуры - не про этот кластер

  • «00150» - «Яндекс Дропс с Алисой, yndx 00150»: старая история про промокоды.
  • «aero» - «geo aero ai продвижение в Екатеринбурге»: маркетинговый запрос.
  • «brutalism» - группа Brutalism; спрашивают, применяет ли она нейросети.
  • «girlfriends» - «aiko ai girlfriends взлом»: серая тема, тут не поможем.
  • «gptunell» - «тоннели» к ChatGPT: серая зона доступа, к API не относится.
  • «matter» и «tuya» - умный дом с Алисой.
  • «neuralink» - компания Маска про чипы в мозг; к OpenAI не относится.
  • «nolimit» - «nolimit gpt часы»: сторонний аксессуар с ассистентом.
  • «notewise» - приложение для заметок, сосед Perplexity и GoodNotes по запросам.
  • «nwsf» - обрывок запроса про промпты для DeepSeek.
  • «openx» - «openx gemini»: ещё одна сторонняя обёртка.
  • «roborock» - роботы-пылесосы; нейросети там про навигацию.
  • «serisi» - «anthropic claude serisi»: «серия» по-турецки, запрос про Claude.
  • «sidebar» - боковая панель Gemini в Chrome.
  • «ttd» - OpenTTD, старая транспортная игра; «open» совпал случайно.
  • «matte» - open matte, видеоформат кадра; не ИИ.
  • «unblock» - «gemini unblock github»: обход блокировок, серая зона.
  • «waymo» - беспилотники Waymo; к переводу речи отношения нет.
  • «wispr» - Wispr Flow, диктовка голосом; близко по смыслу, но не перевод.
  • «zfold7» - складной смартфон Samsung; спрашивают про генерацию картинок.
  • «битрикс24» - «вайб-кодинг в Битрикс24»: корпоративная автоматизация.
  • «вэд» - внешнеэкономическая деятельность; ищут ИИ для таможенных документов.
  • «нмо» - непрерывное медицинское образование; там свои ИИ-сервисы.
  • «рехау» - окна Rehau; выбор окон люди доверяют и нейросетям.
  • «сбр» - «ГигаЧат от Сбера»; другая экосистема, не OpenAI.
  • «тм1» - запросы про ИИ для процессов в корпоративном планировщике ТМ1.
  • «эмп» - «персонаж по ЭМП»: ролевые запросы, не про голос.
  • «юфс» - «рейтинг ЮФС 2026»: смешанные единоборства, прилетели случайно.
  • «а-1001» и «а-1004» - коды ошибок DeepSeek; чинятся на стороне их API.
  • «certification» - «open ai certification»: официальной сертификации у OpenAI нет.
  • «отсчет» - «нейросеть, напиши отчёт по практике»: текстовая задача, не голосовая.
  • «spoken» - «open spoken ai»: так называют голосовые модели OpenAI; точное имя - Realtime API.
  • «мертвого» - «теория мёртвого интернета»: философский соседний запрос.
  • «обнаженная» - запросы на генерацию обнажённых изображений и «сливы»; Realtime API такое не обслуживает: классификаторы прерывают сессию прямо на ходу.
Один ключ и рублёвый баланс вместо зарубежной карты - единый API provod.ai

provod.ai — единая основа для AI-функций бизнеса

Стройте ассистентов, поиск, автоматизацию и медиасценарии поверх одного совместимого слоя: команда быстрее развивает продукт и не поддерживает отдельную инфраструктуру для каждого поставщика.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Фундамент остаётся экономически прозрачным: цены соответствуют официальным тарифам 1:1, без собственной наценки provod.ai; оплата в рублях и документы упрощают работу компании.

Подключите AI к своему продукту: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

FAQ

Коротко: пять быстрых ответов - про деньги, языки, бесплатный доступ и задержку.

«open ai fm» - это переводчик?

Нет. openai.fm - демо синтеза речи gpt-4o-mini-tts: текст внутрь, голос наружу. Живой перевод делает другая модель - gpt-realtime-translate в Realtime API.

Сколько стоит минута перевода?

$0.034 за минуту аудио по официальному анонсу OpenAI, тарификация за длительность. По курсу ЦБ РФ на 08.05.2026 это около 2.54 ₽; час двустороннего разговора - примерно $2.04, около 152 ₽.

Русский язык поддерживается?

Да, он входит в 13 выходных языков. На вход модель понимает больше 70 языков и определяет их сама.

Можно ли пользоваться бесплатно?

В API бесплатного тира нет, биллинг начинается с Tier 1. Альтернатива внутри ChatGPT - перевод голосом через GPT-Live; у него нет API, список языков не опубликован, а тариф и доступность нужно проверять отдельно.

Какая задержка в реальности?

Медианно 711 мс до первого переведённого звука по замеру LiveLingo от 10.06.2026, но на плотной речи перевод отстаёт: медиана 3.8 секунды, дрейф до 20.3. Цифры «полсекунды» из вторичных обзоров не подтвердились.

Где я бы провёл границу применимости. Живая поддержка и мероприятия прощают кривой смысл, если ответ звучит мгновенно; переговоры с контрактами, именами и числами - нет, там подмена одного имени собственного стоит дороже любой задержки. Отсюда спорный вывод: gpt-realtime-translate выигрывает там, где важнее темп, и проигрывает там, где важна точность. Если у тебя другой опыт - расскажи в комментариях, особенно про редкие языковые пары.

А подключение остаётся вопросом биллинга, а не кода. Если пайплайн готов, а платить OpenAI напрямую нечем, логично смотреть в сторону единого API с рублёвым балансом - код при этом не меняется.

Источники