Skip to main content
OpenAI ha proporcionado recientemente una interfaz para crear respuestas de modelos. Proporcione entradas de texto o imágenes para generar salidas de texto o imágenes. Permita que el modelo llame a su propio código personalizado o utilice herramientas integradas, como búsqueda web o búsqueda de archivos, para utilizar sus propios datos como entrada para las respuestas del modelo. Este documento presenta principalmente el proceso de uso de las operaciones de OpenAI Responses API; con ella podemos utilizar fácilmente la función oficial de OpenAI para crear respuestas de modelos.

Proceso de solicitud

Para utilizar OpenAI Responses API, primero vaya a la consola de Ace Data Cloud para obtener su API Token y guárdelo como respaldo. Si aún no ha iniciado sesión o no se ha registrado, será redirigido automáticamente a la página de inicio de sesión para invitarle a registrarse e iniciar sesión; al finalizar, volverá automáticamente a la página actual. Un solo API Token puede llamar a todos los servicios de la plataforma, sin necesidad de solicitar uno por separado para cada servicio. La primera solicitud incluye crédito gratuito, que permite una experiencia gratuita; cuando el crédito sea insuficiente, puede recargar saldo general en la consola.
📘 Documentación completa: OpenAI Responses API →

Uso básico

A continuación, puede completar el contenido correspondiente en la interfaz, como se muestra en la imagen:

Al utilizar esta interfaz por primera vez, necesitamos completar al menos tres contenidos: uno es authorization, que puede seleccionarse directamente en la lista desplegable. Otro parámetro es model; model es la categoría de modelo del sitio web oficial de OpenAI ChatGPT que elegimos utilizar. Aquí contamos principalmente con 20 tipos de modelos; para más detalles puede consultar los modelos que proporcionamos. El último parámetro es input; input es el arreglo de consultas que introducimos. Es un arreglo, lo que indica que se pueden cargar varias consultas al mismo tiempo. Cada consulta contiene role y content, donde role indica el rol del consultante. Proporcionamos tres identidades: user, assistant y system. El otro, content, es el contenido específico de nuestra consulta. Al mismo tiempo, puede observar que hay una generación de código de llamada correspondiente a la derecha. Puede copiar el código y ejecutarlo directamente, o hacer clic directamente en el botón «Try» para realizar pruebas. Parámetros opcionales comunes:
  • max_tokens: limita el número máximo de tokens en una sola respuesta.
  • temperature: aleatoriedad de la generación, entre 0 y 2; cuanto mayor sea el valor, más divergente será.
  • n: cuántas respuestas candidatas se generan de una vez.
  • response_format: configuración del formato de retorno.
  • tools: definición de llamadas a funciones/herramientas.
  • background: si se ejecuta de forma asíncrona en segundo plano.

Después de la llamada, encontramos que el resultado devuelto es el siguiente:
El resultado devuelto cuenta con varios campos, que se presentan a continuación:
  • id, el ID que genera esta tarea de conversación, utilizado para identificar de forma única esta tarea de conversación.
  • model , el modelo del sitio web oficial de OpenAI ChatGPT seleccionado.
  • output, la información de respuesta proporcionada por ChatGPT para la consulta.
  • usage : información estadística sobre los tokens de esta sesión de preguntas y respuestas.
Entre ellos, output contiene la información de respuesta de ChatGPT; el output dentro de él es ChatGPT, como se puede observar en la imagen.

Se puede ver que el campo content dentro de output contiene el contenido específico de la respuesta de ChatGPT.

Respuesta en streaming

Esta interfaz también admite respuestas en streaming, lo cual es muy útil para la integración con páginas web y permite que la página web logre un efecto de visualización carácter por carácter. Si desea devolver la respuesta en streaming, puede cambiar el parámetro stream en el encabezado de la solicitud a true. La modificación se muestra en la imagen; sin embargo, el código de llamada debe tener los cambios correspondientes para admitir respuestas en streaming.

Después de modificar stream a true, la API devolverá los datos JSON correspondientes línea por línea; a nivel de código, necesitamos realizar las modificaciones correspondientes para obtener los resultados línea por línea. Código de llamada de ejemplo en Python:
El efecto de salida es el siguiente:
Se puede ver que hay muchos data en la respuesta, y el delta dentro de data es el contenido de respuesta más reciente, lo cual es consistente con el contenido presentado anteriormente. delta es el contenido de respuesta añadido, puede integrarlo en su sistema según el resultado. La respuesta en streaming utiliza response.completed o response.incomplete como estado final; el usage en el estado final es el uso final de tokens de esta solicitud y también la base de facturación. Si el cliente desconecta la conexión antes de que llegue el estado final, esta solicitud se registra como cerrada por el cliente (499), y no se facturará utilizando la estimación local de tokens; si la conexión termina normalmente pero no se recibe el estado final ni el usage final, esta solicitud se registra como respuesta incompleta (502), y tampoco se facturará utilizando la estimación de tokens. Cuando se encuentre con estas dos situaciones, vuelva a iniciar la solicitud. El resultado data devuelto tiene varios campos en total, que se presentan a continuación:
  • item_id, el ID de la tarea de conversación generada esta vez, utilizado para identificar de forma única esta tarea de conversación.
  • type, el tipo de la tarea de Responses de conversación generada esta vez.
  • model , el modelo seleccionado del sitio web oficial de OpenAI ChatGPT.
  • delta, la información de respuesta proporcionada por ChatGPT para las palabras de consulta.
JavaScript también es compatible, por ejemplo, el código de llamada en streaming de Node.js es el siguiente:
Código de ejemplo de Java:
Otros lenguajes pueden adaptarse por su cuenta, el principio es el mismo.

Conversación de múltiples turnos

Si desea integrar la función de conversación de múltiples turnos, necesita cargar múltiples palabras de consulta en el campo input; un ejemplo específico de múltiples palabras de consulta se muestra en la siguiente imagen:

Código de llamada de ejemplo en Python:
Al cargar múltiples palabras de consulta, se puede implementar fácilmente una conversación de múltiples turnos y se puede obtener la siguiente respuesta:
Se puede ver que la información incluida en output es consistente con el contenido del uso básico; esto incluye el contenido específico de la respuesta de ChatGPT a múltiples conversaciones, de esta manera se pueden responder las preguntas correspondientes según el contenido de múltiples conversaciones.

Modelo visual

gpt-4o es un modelo de lenguaje grande multimodal desarrollado por OpenAI; añade capacidades de comprensión visual sobre la base de GPT-4. Este modelo puede procesar simultáneamente entradas de texto e imágenes, logrando comprensión y generación multimodal. El procesamiento de texto utilizando el modelo gpt-4o es coherente con el contenido básico de uso mencionado anteriormente. A continuación, se presentará brevemente cómo utilizar la capacidad de procesamiento de imágenes del modelo. La capacidad de procesamiento de imágenes del modelo gpt-4o se utiliza principalmente añadiendo un campo type sobre la base del contenido original de content. Mediante este campo se puede saber si lo que se carga es texto o una imagen, para así utilizar la capacidad de procesamiento de imágenes del modelo gpt-4o. A continuación se describe principalmente cómo llamar a esta función mediante Curl y Python.
  • Método de script Curl
  • Método de script Python
Luego se puede obtener el siguiente resultado. La información de los campos del resultado es coherente con la mencionada anteriormente, específicamente de la siguiente manera:
Se puede ver que el contenido de la respuesta se basa en la imagen. Por lo tanto, mediante los dos métodos anteriores se pueden utilizar fácilmente las capacidades de procesamiento de texto e imágenes del modelo gpt-4.1. Además de gpt-4.1, existe un modelo de menor costo llamado gpt-4o-mini. gpt-4o-mini es la última generación de modelos de lenguaje grandes desarrollada por OpenAI. No solo tiene una velocidad de respuesta rápida, sino que también es más económico y admite multimodalidad. Para el uso de la función vision, se puede consultar el contenido anterior sobre el uso del modelo gpt-4.1.

Creación del modelo de procesamiento de archivos

Ejemplo de solicitud:
Resultado de ejemplo:
Se puede ver que también hemos procesado los archivos de entrada, y el resultado es similar al anterior.

Manejo de errores

Al llamar a la API, si se produce un error, la API devolverá el código de error y la información correspondientes. Por ejemplo:
  • 400 token_mismatched:Solicitud incorrecta, posiblemente debido a parámetros faltantes o no válidos.
  • 400 api_not_implemented:Solicitud incorrecta, posiblemente debido a parámetros faltantes o no válidos.
  • 401 invalid_token:No autorizado, token de autorización no válido o faltante.
  • 429 too_many_requests:Demasiadas solicitudes, ha excedido el límite de tasa.
  • 500 api_error:Error interno del servidor, algo salió mal en el servidor.

Ejemplo de respuesta de error

Conclusión

A través de este documento, ya ha aprendido cómo utilizar la API de OpenAI Responses para implementar fácilmente la funcionalidad oficial de creación de Responses de OpenAI. Esperamos que este documento pueda ayudarle a integrar y utilizar mejor esta API. Si tiene alguna pregunta, no dude en ponerse en contacto con nuestro equipo de soporte técnico.