Ubunlog Diego Germán González  

Qué es la API de OpenAI y para que sirve

Web de la plataforma de OpenAi


La mayoría de la gente está acostumbrada a interactuar con ChatGPT y otros modelos de inteligencia artificial con su interfaz web, ya sea en el modo gratuito o pagando suscripciones. Sin embargo, hay otras formas de hacerlo, por lo que en este artículo veremos qué es la API de OpenAI.
En este artículo vamos a explicar los conceptos introductorios y, en el que viene, veremos cómo usarla con algunos ejemplos.

Interacción con modelos: API vs. chat

En primer lugar, debemos entender que, aunque estemos hablando de la misma empresa, no es lo mismo ChatGPT que la API de OpenAI, aunque consulten los mismos modelos y generen los mismos resultados.

ChatGPT es una aplicación completa que incluye la interfaz, el historial de conversaciones, archivos, herramientas y otras funciones.
Con la API, en cambio, es el usuario quien decide cómo se conecta con el modelo y qué se hace con la respuesta una vez que fue generada.

¿Qué es una API?

Una API (siglas de Interfaz de Programación de Aplicaciones, o Application Programming Interface) consiste en un conjunto de reglas y protocolos que facilitan que diferentes aplicaciones de software se comuniquen e intercambien datos entre sí.

¿Qué es la API de OpenAI?

En el caso de OpenAI (la empresa creadora de ChatGPT), su API permite utilizar los modelos de inteligencia artificial de OpenAI desde otros programas, sitios web y scripts; no es necesario ingresar a la web de ChatGPT ni introducir los prompts de manera manual.

Un ejemplo de cómo funciona esto sería una aplicación que le envía a la API una pregunta y un documento, y recibe una respuesta basada en la información del documento subido. Esto permite incorporar capacidades de IA directamente en un programa. Esta es la forma en que trabajan algunos programas, como la suite ofimática OnlyOffice.

Formas de utilizar la API

  • Escribiendo código: se puede usar un lenguaje de programación para desarrollar un programa (o pedirle a ChatGPT que lo haga) que se conecte a los servidores de la empresa, transmita la solicitud y procese la respuesta.
  • Desde un sitio web: las empresas pueden establecer una conexión entre un sitio web y los modelos de OpenAI para, por ejemplo, crear un asistente virtual.
  • Desde aplicaciones de escritorio o móviles: para agregar funciones de inteligencia artificial. Es el caso que vimos más arriba con la suite ofimática OnlyOffice. De esta forma, el modelo de inteligencia artificial puede asistir al usuario en tiempo real con el trabajo que está haciendo.
  • Mediante servicios de terceros: existen plataformas que dan acceso a modelos de varios proveedores, ofreciendo su propia versión de ChatGPT y evitando al usuario atarse a un solo proveedor.

Un punto a destacar es que la API no es gratis y tampoco se parece a pagar una suscripción a ChatGPT.
La API se paga en función del consumo. El costo final dependerá del modelo a utilizar y de la cantidad de tokens procesados. Determinados servicios y modelos pueden tener estructuras de precios diferentes.
ChatGPT, en cambio, ofrece modelos de tarifa plana con límites de uso más generosos y funciones adicionales para distintos tipos de actividades.
De todas formas, hay que aclarar que, dependiendo del uso y del modelo, el costo es bastante económico. Yo he traducido novelas completas por 20 centavos de dólar y obtenido respuestas extensas por solo 1.

Las diferentes interfaces de la API de OpenAI

Podemos usar diferentes formas de conectarnos con la API de OpenAI. Estas son:

Responses API

Es la forma principal de interacción con los modelos de OpenAI desde una aplicación. Se usa para enviar instrucciones y recibir respuestas. También puede trabajar con distintos tipos de contenido y herramientas.

Se puede usar para: chatbots, asistentes virtuales, generación y análisis de textos, programación, análisis de imágenes y documentos, entre otras posibilidades.
Por ejemplo: una aplicación donde el usuario envía un texto y recibe un cuestionario sobre el mismo.

Batch API

Está diseñada para procesar grandes cantidades de solicitudes de manera asíncrona. El usuario no espera una respuesta inmediatamente después de realizar cada consulta. Se prepara un conjunto de solicitudes y se envía como un trabajo.

Se puede usar para: analizar miles de documentos, clasificar grandes cantidades de textos, generar descripciones de productos o procesar grandes conjuntos de datos.
Por ejemplo, se pueden enviar todos los libros de una colección para que el modelo devuelva un resumen de cada uno.

Embeddings API

Se usa para transformar textos en representaciones numéricas llamadas embeddings. Los embeddings se usan para comparar textos según su significado, en lugar de limitarse a las palabras que contienen.

Se puede usar para: búsquedas semánticas, sistemas RAG (conectar el modelo a una base de datos externa y actualizable para mejorar sus respuestas), recomendaciones, clasificación de documentos y detección de contenidos similares.
Por ejemplo: buscar soluciones a los problemas que plantea el usuario, quien, por no ser especialista en informática, no conoce la jerga de la profesión.

Moderation API

Se usa para analizar contenido y detectar determinadas categorías de contenido potencialmente problemático, como pornografía o contenido violento. Es especialmente útil para actuar como un mecanismo de seguridad dentro de una aplicación que recibe material generado por los usuarios.

Se puede usar para: moderación de comentarios, foros, redes sociales, chats y en otras aplicaciones donde la publicación de contenidos no esté restringida.
Por ejemplo: antes de publicar un video, una web para adultos puede verificar que quienes aparecen no sean menores de edad.

API de audio

Permite interactuar con el modelo trabajando con contenido de voz y audio. Entre otras cosas, puede convertir audio en texto o generar audio a partir de texto. Esto dependerá del modelo que se utilice y de cuánto se quiera gastar.

Se puede usar para: transcripción de reuniones, subtitulado de videos, asistentes por voz, construcción de herramientas de accesibilidad y producción de contenido hablado.
Por ejemplo: una aplicación envía la grabación de un discurso y recibe una transcripción que posteriormente puede enviarse a un modelo de texto para destacar los puntos clave.

API de imágenes

Se usa para interactuar con los modelos de OpenAI con capacidades para generar y modificar imágenes a partir de las instrucciones de los usuarios.

Se puede usar para: crear ilustraciones de artículos, producir material gráfico, crear prototipos, generar imágenes para redes sociales y editar imágenes existentes.
Por ejemplo: podemos enviar un artículo y pedir que nos genere una imagen que lo ilustre.
En el próximo artículo veremos cómo interactuar con la API.

Artículo original

Leave A Comment

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.