GenKaKu 작동 방식
흐름
사용자 → 오케스트레이터 → 워커 → 토큰 스트리밍 → 사용자
- genkaku.app 채팅 인터페이스에서 메시지를 보냅니다
- 오케스트레이터가 요청을 받고 필요한 모델을 제공하는 워커를 찾습니다
- 워커는 GPU에서 추론을 실행하고 오케스트레이터를 통해 토큰을 스트리밍합니다
- 실시간으로 응답이 단어별로 표시됩니다
오케스트레이터
오케스트레이터는 Socket.io를 사용하여 실시간 통신을 하는 Node.js 서버입니다. 다음을 처리합니다:
- 인증 — Privy를 통해 사용자와 워커를 확인합니다
- 작업 큐 — 들어오는 요청을 관리하고 사용 가능한 워커와 매칭합니다
- 워커 레지스트리 — 온라인 워커, 해당 기능 및 현재 부하를 추적합니다
- 라우팅 — 요청된 모델에 대해 올바른 워커 유형으로 작업을 지시합니다
- 워커 선택 — 유휴 워커 중 하나를 선택하여 작업을 할당합니다 (측정된 토큰/초 기준 가중 랜덤)
- 도구 호출 — 모델이 요청할 때 웹 검색을 실행하고 결과를 반환합니다
- 통계 — 5초마다 실시간 네트워크 통계를 방송합니다
오케스트레이터는 대화를 저장하지 않습니다. 트래픽을 라우팅하고 계속 진행합니다.
워커
워커는 기계에서 실행되며 GenKaKu 네트워크에 추론 작업을 제공하는 데스크톱 애플리케이션입니다. GenKaKu Worker 앱을 다운로드하고 로그인하면 GPU가 수익을 올리기 시작합니다 — 명령줄 설정이 필요 없습니다.
워커는 모델 서빙을 위해 내부적으로 Ollama를 사용하며, CUDA(NVIDIA), Metal(Apple Silicon), Vulkan(AMD/Intel) 가속을 지원합니다. 네트워크의 주요 텍스트 모델인 Qwen3.8 27B Uncensored를 실행하며, 라우팅되는 모든 채팅 메시지와 API 요청을 처리합니다.
하드웨어 요구 사항: 16GB 이상의 NVIDIA GPU(24GB 권장), 24GB 이상의 AMD 카드 또는 32GB 이상의 Apple Silicon Mac. 하드웨어에 따라 성능이 다르지만, 적절한 GPU에서 초당 25개 이상의 토큰을 기대할 수 있습니다.
작업을 제공하지 않을 때 워커는 백그라운드에서 유휴 상태로 실행됩니다. 위젯 모드로도 실행할 수 있습니다 — GPU 활용률, USDC 수입 및 $GENKAKU 수익을 한눈에 보여주는 컴팩트한 오버레이. 로컬 Ollama 모델로 구동되는 내장 교육 어시스턴트가 앱을 떠나지 않고 문제를 해결하는 데 도움을 줍니다.
연결 방법
- GenKaKu Worker 앱을 열고 GenKaKu 계정으로 로그인합니다
- 앱이 오케스트레이터에 등록하고 GPU 기능을 발표합니다
- 워커가 유휴 상태이고 모델이 요청과 일치할 때 오케스트레이터가 작업을 라우팅합니다
- GPU가 추론을 실행하고 오케스트레이터를 통해 토큰을 스트리밍합니다
- 완료된 각 작업에 대해 USDC를 얻습니다 — 앱의 대시보드에서 확인할 수 있습니다
수익
워커는 완료한 작업량에 비례하여 USDC를 얻습니다. 요금은 제공되는 모델과 현재 네트워크 수요에 따라 다릅니다. 수익은 실시간으로 누적되며 데스크톱 앱과 GenKaKu 계정 대시보드 모두에서 표시됩니다.
보상
USDC 수익 외에도, 워커는 서비스 품질에 따라 $GENKAKU 보상을 얻습니다. 보상 공식은 여러 성능 요소를 고려합니다:
보상을 증가시키는 성능 지표:
- 초당 토큰 수 — 더 빠른 GPU가 더 많은 토큰을 생성하고 더 높은 보상을 얻습니다
- 낮은 지연 시간 — 워커와 오케스트레이터 사이의 빠른 응답 시간
- 가동 시간 — 온라인 상태로 가용 가능한 시간이 길수록 더 많이 벌니다
- 작업 완료율 — 오류나 시간 초과 없이 작업을 성공적으로 완료
- 연결 안정성 — 일관되고 안정적인 네트워크 연결
- 일관성 — 지속적인 안정적 성능, 단순한 간헐적 버스트가 아닌
보상을 감소시키는 요소:
- 작업 중 연결 끊김
- 느린 토큰 생성
- 높은 지연 시간 또는 불안정한 네트워크
- 실패하거나 시간 초과된 작업
- 빈번한 연결 끊김
유휴 보상: 작업이 할당되지 않더라도 온라인 상태를 유지하면 소량의 $GENKAKU 보상을 얻습니다 — 네트워크는 용량을 유지하고 서비스 준비 상태를 유지하는 워커에게 보상합니다.
이미지 워커
이미지 워커는 또 다른 워커 유형입니다: 이미지 생성을 위해 ComfyUI를 실행하는 독립적인 GPU입니다. 텍스트 모델이 그림을 요청할 때 호출할 수 있는 generate_image 도구와 이미지 API로 노출됩니다 — 어떤 경우든 이미지 워커가 결과를 렌더링합니다.
작업 라우팅
| 레인 | 워커 유형 | 모델 |
|---|---|---|
채팅 + qwen3.8-27b-uncensored | 데스크톱 워커 (Ollama) | Qwen3.8 27B Uncensored |
| 이미지 생성 | ComfyUI | Chroma1-HD |
워커 선택
작업이 준비되면 오케스트레이터는 요청된 모델을 제공하는 유휴 워커를 살펴보고 가중 랜덤 선택으로 하나를 골라합니다. 각 워커의 가중치는 측정된 평균 토큰/초입니다 (가장 느린 워커도 약간의 트래픽을 받도록 바닥이 설정됩니다). 더 빠른 워커가 더 많은 작업을 받지만, 항상 가장 빠른 단일 워커에 도달하는 대신 전체 풀에 걸쳐 작업과 수익이 분산됩니다.
웹 검색
웹 검색은 모델 주도입니다. 모델 자체가 web_search 도구를 호출할지 결정합니다. 호출하면 오케스트레이터가 검색을 실행하고(Brave Search API) 결과를 도구 결과로 모델에 반환하면 모델은 계속 진행합니다 — 프리페치가 아닌 왕복입니다. 그런 다음 모델은 실제 최신 웹 콘텐츠에 기반한 정보로 응답하고 출처를 인용합니다.
토큰 스트리밍
응답은 실시간으로 스트리밍됩니다. 워커가 각 토큰을 생성할 때마다 즉시 사용자에게 전송됩니다. 전체 응답을 기다릴 필요가 없습니다 — 다른 채팅 AI처럼 실시간으로 작성되는 것을 볼 수 있지만, 컴퓨팅은 네트워크의 다른 사람의 GPU에서 발생합니다.