Audio
OpenAI lanza modelos de audio de última generación
OpenAI presenta una nueva suite de modelos de audio para potenciar agentes de voz, ahora disponibles para desarrolladores en todo el mundo.
Estos modelos representan un gran avance en la interacción humano-computadora, permitiendo experiencias más naturales e intuitivas a través del lenguaje hablado.
En los últimos meses, se ha invertido en el avance de la inteligencia, capacidades y utilidad de los agentes basados en texto — sistemas que realizan tareas de forma independiente para los usuarios — con lanzamientos como Operator, Deep Research, Computer-Using Agents y la API de Respuestas con herramientas integradas. Sin embargo, para que los agentes sean realmente útiles, las personas necesitan interacciones más profundas e intuitivas que trasciendan el texto, utilizando el lenguaje natural hablado para comunicarse eficazmente.
Precisión y fiabilidad mejoradas en reconocimiento de voz
Los nuevos modelos de reconocimiento de voz (speech-to-text) establecen un nuevo estándar, superando a las soluciones existentes en precisión y confiabilidad, especialmente en escenarios desafiantes como acentos, entornos ruidosos y velocidades de habla variables. Estas mejoras aumentan la confiabilidad de la transcripción, haciendo que los modelos sean especialmente adecuados para casos de uso como centros de atención al cliente, transcripción de notas de reuniones y más. El modelo gpt-4o-transcribe, por ejemplo, muestra una mejora significativa en la tasa de error de palabras (WER) en comparación con los modelos Whisper existentes.
La tasa de error de palabras (WER) mide la precisión de los modelos de reconocimiento de voz calculando el porcentaje de palabras transcritas incorrectamente en comparación con una transcripción de referencia; un WER más bajo es mejor y significa menos errores. Nuestros últimos modelos de reconocimiento de voz logran un WER más bajo en los puntos de referencia, incluido FLEURS (Evaluación de Aprendizaje de Pocos Disparos de Representaciones Universales del Habla), un punto de referencia de habla multilingüe que abarca más de 100 idiomas utilizando muestras de audio transcritas manualmente. Estos resultados demuestran una mayor precisión de transcripción y una cobertura de idiomas más sólida. Como se muestra, nuestros modelos superan constantemente a Whisper v2 y Whisper v3 en todas las evaluaciones de idiomas.
Voz personalizada con text-to-speech
Por primera vez, los desarrolladores pueden indicar al modelo de texto a voz (text-to-speech) cómo hablar; por ejemplo, “habla como un agente de servicio al cliente comprensivo”, lo que permite un nuevo nivel de personalización para los agentes de voz. Esto permite una amplia gama de aplicaciones personalizadas, desde voces de servicio al cliente más empáticas y dinámicas hasta narraciones expresivas para experiencias creativas de narración. El modelo gpt-4o-mini-tts ofrece esta capacidad mejorada de dirección.
En comparación con otros modelos líderes, en FLEURS, nuestros modelos ofrecen un WER más bajo y un sólido rendimiento multilingüe. Como se muestra, nuestros modelos igualan o superan a otros modelos líderes en la mayoría de los idiomas principales.
Innovaciones técnicas detrás de los modelos
Preentrenamiento con conjuntos de datos de audio auténticos
Los nuevos modelos de audio se basan en las arquitecturas GPT-4o y GPT-4o-mini y se entrenaron extensamente en conjuntos de datos específicos centrados en audio, lo que ha sido fundamental para optimizar el rendimiento del modelo. Este enfoque proporciona una visión más profunda de los matices del habla y permite un rendimiento excepcional en tareas relacionadas con el audio.
Metodologías de destilación avanzadas
Se han mejorado las técnicas de destilación, lo que permite la transferencia de conocimiento de nuestros modelos de audio más grandes a modelos más pequeños y eficientes. Aprovechando las metodologías avanzadas de juego propio, los conjuntos de datos de destilación capturan eficazmente las dinámicas conversacionales realistas, lo que replica las interacciones genuinas entre el usuario y el asistente. Esto ayuda a que nuestros modelos más pequeños brinden una excelente calidad y capacidad de respuesta conversacional.
Paradigma de aprendizaje por refuerzo
Para los modelos de reconocimiento de voz, se ha integrado un paradigma con fuerte énfasis en el aprendizaje por refuerzo (RL), llevando la precisión de la transcripción a niveles de vanguardia. Esta metodología mejora drásticamente la precisión y reduce las alucinaciones, haciendo que nuestras soluciones de reconocimiento de voz sean excepcionalmente competitivas en escenarios complejos de reconocimiento de voz.
Disponibilidad de la API
Estos nuevos modelos de audio están disponibles para todos los desarrolladores. Para los desarrolladores que ya están creando experiencias conversacionales con modelos basados en texto, agregar nuestros modelos de reconocimiento de voz y texto a voz es la forma más sencilla de crear un agente de voz. Se está lanzando una integración con el SDK de Agentes que simplifica este proceso de desarrollo. Para los desarrolladores que buscan crear experiencias de voz a voz de baja latencia, se recomienda crear con nuestros modelos de voz a voz en la API en tiempo real.
El futuro de los modelos de audio
OpenAI planea continuar invirtiendo en la mejora de la inteligencia y la precisión de sus modelos de audio y explorar formas de permitir que los desarrolladores aporten sus propias voces para crear experiencias aún más personalizadas de una manera que se alinee con sus estándares de seguridad. Además, continúan participando en conversaciones con legisladores, investigadores, desarrolladores y creativos sobre los desafíos y las oportunidades que pueden presentar las voces sintéticas. También se invertirá en otras modalidades, incluido el video, para permitir a los desarrolladores crear experiencias agenciales multimodales.
Audio
Oats: la herramienta de IA open source para notas de reuniones locales y privadas
Oats graba tus reuniones directamente en tu Mac o Windows, genera resúmenes y listas de tareas sin usar bots ni nubes externas. Es open-source, gratuita y se integra con Obsidian. Descubre cómo funciona y por qué es una alternativa revolucionaria a herramientas como Otter.ai.
Android
Podcast ONE: 11 de septiembre de 2026
Apple
Apple Surprise and Shine 2026: todos los lanzamientos, precios y análisis de actualización
El 9 de septiembre de 2026, Apple presentó en su evento Surprise and Shine sus productos más esperados del año: el iPhone 18 Pro, iPhone 18 Pro Max, el primer iPhone plegable Duo, los AirPods 5, el Apple Watch Series 12 y el Apple Watch Ultra 4. Aquí te ofrecemos un resumen validado con imágenes oficiales de Apple, precios, especificaciones técnicas, y un análisis crítico para decidir si vale la pena actualizar.
-
Apps11 años agoAMPcast, la herramienta de Pandora que permite a los artistas grabar mensajes de audio directamente a sus seguidores
-
Blogs5 años agoConoce los mejores sitios de Torrents para descargar todo tipo de contenidos
-
Android5 años agoAprende cómo usar Discord para ver películas con tus amigos
-
Arte y Cultura13 años agoColección de fondos de pantalla basados en Super Héroes
-
Almacenamiento2 años agoCómo usar TeraBox: La guía definitiva para aprovechar 1 TB de almacenamiento en la nube
-
Diseño13 años agocss3ps: plugin que convierte archivos PSD a CSS3
-
Apps9 años agoPicturethat, app que usa la Realidad Aumentada para visualizar cómo quedarían los cuadros antes de colgarlos
-
Eventos Especiales13 años agoEspecial Día de la Madres: fondos de pantalla especiales para Mamá

