OpenAI представи GPT‑Realtime‑2 и две нови гласни версии, достъпни само чрез API
OpenAI разширява възможностите на гласовия API
Компанията обяви стартирането на нови функции за своя API, които ще позволят разработчиците да създават по „живи“ гласови приложения: те ще могат да разговарят с потребителите, транскрибирайки реч в текст и превеждайки разговорите на лету.
Нови модели Realtime
Чрез интерфейса Realtime вече са достъпни три модела:
МоделНазначениеКлючови особеностиGPT‑Realtime‑2Гласово взаимодействие в реално времеАнализ на заявки, извикване на инструменти, обработка на корекции и плавно продължение на диалога. Базирана е на логиката GPT‑5, което позволява да се справя с по-сложни задачи в сравнение с GPT‑Realtime‑1.5.GPT‑Realtime‑TranslateПревод в реално времеПоддържа над 70 езика за въвеждане и 13 езика за изход. Запазва смисъла дори при промяна на контекста, регионални акценти или специализирана терминология.GPT‑Realtime‑WhisperТранскрипция на речПотоков модел с ниска закъснение, превръщащ аудио в текст почти мигновено.
> „Нашите нови модели превеждат аудио в реално време от прост диалог към гласови интерфейси, които всъщност могат да работят: слушат, размишляват, превеждат, транскрибирайки и предприемат действия по мярка на развитието на разговора“, — заяви компанията.
Цени
МоделЦенаGPT‑Realtime‑2$32 за 1 млн входни аудио токена, $0.40 за 1 млн кеширани токена и $64 за 1 млн изходни аудио токенаGPT‑Realtime‑Translate$0.034 на минутаGPT‑Realtime‑Whisper$0.017 на минута
Как да пробвате
Разработчиците могат да тестват новите модели на онлайн платформата OpenAI Playground и незабавно да видят как работят в реално време.
Коментари (0)
Споделете мнението си — моля, бъдете учтиви и по темата.
Влезте, за да коментирате