Un solo endpoint de inferencia con memoria de sesión real, ejecución paralela entre nodos y soporte para tus propios modelos. No administrás GPUs — administrás conversaciones y tareas.
Simplificado: en la práctica /infer te devuelve un job_id al instante y consultás el resultado por separado — ver la secuencia completa más abajo.
La memoria vive en el servidor, no en el nodo. Ningún nodo necesita recordar nada para que la conversación tenga sentido.
Partí una tarea en subtareas, corrélas en distintos nodos al mismo tiempo, y recibí un solo resultado agregado.
Subís tus pesos, la red los distribuye a los nodos con capacidad suficiente y los servís como cualquier otro modelo.
Mandá la misma pregunta a varios nodos y quedate con la primera respuesta válida — el resto se cancela solo.
/infer es asíncrono: te devuelve un job_id al instante, no la respuesta del modelo (que puede tardar varios segundos). Hace falta un segundo pedido para consultar el resultado.
Sin código: entrá a tu consola (creando cuenta con Google o GitHub) → API Keys → Crear API key. El valor sk_live_... se muestra una sola vez, guardalo.
Creá una sesión una vez (POST /sessions, mismo header) y mandá el session_id que te devuelve en cada /infer siguiente — sin eso, cada llamada es 100% independiente.
¿No querés escribir nada de esto a mano? El Playground de tu consola ya hace exactamente esta secuencia (sesión + pedido + consulta del resultado) con una interfaz de chat.
Estos son los bodies que le mandás a POST /infer — el resto de la secuencia (header, consulta del resultado) es igual en los tres casos, ver arriba.
Sin tarjeta para probar. Creás cuenta con Google o GitHub y te damos una API key al instante.
Crear cuenta →