Con el objetivo de recabar estos datos, usamos las conversaciones de los entrenadores de IA con el chatbot. Les dimos acceso a las sugerencias propuestas por el modelo para que lo ayudaran a articular las respuestas. Entrenamos este modelo usando el aprendizaje por refuerzo a partir de feedback humano (RLHF), empleando los mismos métodos que en InstructGPT, pero con algunos ajustes distintos sobre la recopilación de datos. ChatGPT es un modelo muy similar al de InstructGPT, que entrenamos para que siga las instrucciones de las solicitudes y responda de forma detallada.
Concluye la investigación de WilmerHale y Altman y Brockman vuelven a liderar OpenAI Los modelos anteriores nos sirvieron para mejorar este, y esperamos emplear las lecciones aprendidas con esta versión para desarrollar sistemas más potentes. Por ejemplo, se han reducido notablemente los resultados erróneos e indeseados tras el uso del aprendizaje por refuerzo con feedback humano (RLHF). El despliegue de modelos anteriores, como GPT‑3 y Codex, ha servido de base para adoptar las medidas de seguridad que se han aplicado en esta versión. Optimizamos ChatGPT a partir de un modelo de la serie GPT‑3.5, cuyo entrenamiento terminó a principios de 2022. A tal fin, recurrimos a las conversaciones que los entrenadores de IA mantuvieron con el chatbot para seleccionar al azar un mensaje redactado por el modelo, extraer varias muestras alternativas y pedir a los formadores de IA que las clasificaran.
Estamos deseando lanzar ChatGPT y conocer la opinión de los usuarios; en definitiva, averiguar sus puntos fuertes y áreas de mejora. Hemos entrenado ChatGPT, un modelo que interactúa con los usuarios como si mantuviera una conversación. grana win Explora preguntas relacionadas con la actividad física, el bienestar y la salud con explicaciones claras y orientación práctica. Usa la voz para generar ideas, practicar, aprender o seguir avanzando cuando no estás frente al teclado.
