Cómo funciona GenKaKu
El flujo
Usuario → Orquestador → Trabajador → tokens se transmiten de vuelta → Usuario
- Envías un mensaje desde la interfaz de chat de genkaku.app
- El orquestador recibe tu solicitud y encuentra un trabajador que sirve el modelo que necesita
- El trabajador ejecuta inferencia en su GPU y transmite tokens de vuelta a través del orquestador
- Ves la respuesta aparecer en tiempo real, palabra por palabra
El orquestador
El orquestador es un servidor Node.js que usa Socket.io para comunicación en tiempo real. Maneja:
- Autenticación — verificación de usuarios y trabajadores a través de Privy
- Cola de trabajos — gestión de solicitudes entrantes y coincidencia con trabajadores disponibles
- Registro de trabajadores — seguimiento de qué trabajadores están en línea, sus capacidades y carga actual
- Enrutamiento — dirigir trabajos al tipo de trabajador correcto para el modelo solicitado
- Selección de trabajadores — elegir qué trabajador ocioso recibe el trabajo (aleatorio ponderado por tokens/seg medidos)
- Llamadas a herramientas — ejecutar búsquedas web cuando un modelo lo solicita, y alimentar los resultados
- Estadísticas — transmitir estadísticas de red en tiempo real cada 5 segundos
El orquestador no almacena conversaciones. Enruta el tráfico y sigue adelante.
Trabajadores
Los trabajadores son aplicaciones de escritorio que se ejecutan en tu máquina y sirven trabajos de inferencia a la red GenKaKu. Descarga la aplicación GenKaKu Worker, inicia sesión y tu GPU comienza a ganar — sin configuración de línea de comandos.
El trabajador usa Ollama internamente para servir modelos, con soporte de aceleración CUDA (NVIDIA), Metal (Apple Silicon) y Vulkan (AMD/Intel). Ejecuta Qwen3.8 27B Uncensored — el modelo de texto principal de la red — y maneja cada mensaje de chat y solicitud de API que se enruta hacia él.
Requisitos de hardware: una GPU NVIDIA de 16GB+ (24GB recomendado), una tarjeta AMD de 24GB+ o una Mac Apple Silicon de 32GB+. El rendimiento varía según el hardware, pero espera 25+ tokens por segundo con una GPU decente.
Cuando no está sirviendo trabajos, el trabajador permanece inactivo en segundo plano. También puedes ejecutarlo en modo widget — una superposición compacta que muestra tu utilización de GPU, ingresos en USDC y ganancias en $GENKAKU de un vistazo. Un asistente integrado impulsado por un modelo Ollama local te ayuda a resolver problemas sin salir de la aplicación.
Cómo se conecta
- Abres la aplicación GenKaKu Worker e inicias sesión con tu cuenta de GenKaKu
- La aplicación se registra con el orquestador y anuncia las capacidades de tu GPU
- El orquestador enruta trabajos a tu trabajador cuando está inactivo y tu modelo coincide con la solicitud
- Tu GPU ejecuta infiere y transmite tokens de vuelta a través del orquestador
- Ganas USDC por cada trabajo completado — visible en el panel de la aplicación
Ganancias
Los trabajadores ganan USDC proporcionalmente al trabajo completado. La tarifa depende del modelo servido y la demanda actual de la red. Las ganancias se acumulan en tiempo real y se muestran tanto en la aplicación de escritorio como en el panel de tu cuenta de GenKaKu.
Recompensas
Además de las ganancias en USDC, los trabajadores obtienen recompensas en $GENKAKU basadas en la calidad del servicio. La fórmula de recompensa considera varios factores de rendimiento:
Métricas de rendimiento que aumentan las recompensas:
- Tokens por segundo — GPUs más rápidas generan más tokens y obtienen mayores recompensas
- Baja latencia — tiempos de respuesta rápidos entre tu trabajador y el orquestador
- Tiempo de actividad — cuanto más tiempo permanezcas en línea y disponible, más ganas
- Tasa de finalización de trabajos — completar trabajos exitosamente sin errores ni tiempo de espera
- Estabilidad de conexión — conectividad de red consistente y confiable
- Consistencia — rendimiento estable a lo largo del tiempo, no solo ráfagas esporádicas
Factores que reducen las recompensas:
- Desconexiones durante un trabajo
- Generación de tokens lenta
- Alta latencia o red inestable
- Trabajos fallidos o agotados
- Desconexiones frecuentes
Recompensas por inactividad: Incluso cuando no se asignan trabajos, permanecer en línea genera una pequeña recompensa en $GENKAKU — la red recompensa a los trabajadores por mantener la capacidad y estar listos para servir.
Trabajadores de imagen
Los trabajadores de imagen son otro tipo de trabajador: GPUs independientes ejecutando ComfyUI para generación de imágenes. Se expone tanto como la herramienta generate_image que el modelo de texto puede llamar cuando pides una imagen, como la API de imagen — de cualquier manera un trabajador de imagen renderiza el resultado.
Enrutamiento de trabajos
| Canalización | Tipo de trabajador | Modelo |
|---|---|---|
Chat + qwen3.8-27b-uncensored | Trabajador de escritorio (Ollama) | Qwen3.8 27B Uncensored |
| Generación de imágenes | ComfyUI | Chroma1-HD |
Selección de trabajadores
Cuando un trabajo está listo, el orquestador examina los trabajadores ociosos que sirven el modelo solicitado y elige uno por selección aleatoria ponderada. El peso de cada trabajador es su tokens/seg promedio medidos (con un mínimo para que los trabajadores más lentos aún reciban algo de tráfico). Los trabajadores más rápidos reciben más trabajos, pero el trabajo y las ganancias se distribuyen por todo el grupo en lugar de recaer siempre en el único trabajador más rápido.
Búsqueda web
La búsqueda web es dirigida por el modelo. El mismo modelo decide cuándo llamar a la herramienta web_search. Cuando lo hace, el orquestador ejecuta la búsqueda (Brave Search API), alimenta los resultados de vuelta al modelo como resultado de herramienta, y el modelo continúa desde ahí — un ida y vuelta, no una precarga. El modelo luego responde con información basada en contenido web real y actualizado, y cita sus fuentes.
Transmisión de tokens
Las respuestas se transmiten en tiempo real. A medida que el trabajador genera cada token, se envía a través del orquestador al usuario inmediatamente. No hay esperas por la respuesta completa — la ves escribirse en vivo, igual que cualquier otro chat de IA, excepto que el cómputo está ocurriendo en la GPU de alguien a través de la red.