GenKaKu 工作原理
流程
用户 → 编排器 → 工作者 → 令牌流式回传 → 用户
- 你从 genkaku.app 聊天界面发送一条消息
- 编排器接收你的请求,并找到一个能运行所需模型的工作者
- 工作者在其 GPU 上执行推理,并通过编排器将令牌流式回传
- 你实时看到响应逐词出现
编排器
编排器是一个使用 Socket.io 进行实时通信的 Node.js 服务器。它处理:
- 认证——通过 Privy 验证用户和工作者
- 任务队列——管理传入请求并将其匹配给可用工作者
- 工作者注册表——跟踪哪些工作者在线、它们的能力和当前负载
- 路由——将任务定向到正确的工作者类型以运行请求的模型
- 工作者选择——选择哪个空闲工作者接收任务(按测量的令牌/秒加权随机选择)
- 工具调用——当模型请求时运行网络搜索,并将结果反馈
- 统计信息——每 5 秒广播一次实时网络统计
编排器不存储对话。它路由流量然后继续处理下一个。
工作者
工作者是在你的机器上运行的桌面应用程序,为 GenKaKu 网络提供推理服务。下载 GenKaKu Worker 应用,登录,你的 GPU 就开始赚取收益——无需命令行设置。
工作者底层使用 Ollama 提供模型服务,支持 CUDA(NVIDIA)、Metal(Apple Silicon)和 Vulkan(AMD/Intel)加速。它运行 Qwen3.8 27B Uncensored——网络的主要文本模型——处理路由到它的所有聊天消息和 API 请求。
硬件要求:16GB 以上 NVIDIA GPU(推荐 24GB)、24GB 以上 AMD 显卡或 32GB 以上 Apple Silicon Mac。性能因硬件而异,但在合适的 GPU 上可达 25+ 令牌/秒。
不提供服务时,工作者在后台空闲运行。你也可以使用小组件模式——一个紧凑的浮层,一目了然地显示 GPU 利用率、USDC 收入和 $GENKAKU 收益。内置的教学助手由本地 Ollama 模型驱动,帮助你无需离开应用即可排除故障。
如何连接
- 打开 GenKaKu Worker 应用并使用你的 GenKaKu 账户登录
- 应用向编排器注册并宣布你的 GPU 能力
- 当你的工作者空闲且模型匹配请求时,编排器将任务路由到你的工作者
- 你的 GPU 执行推理并通过编排器流式回传令牌
- 你为完成的每个任务赚取 USDC——在应用的仪表板中可见
收益
工作者按完成的工作量比例赚取 USDC。费率取决于所提供的模型和当前的网络需求。收益实时累积,可在桌面应用和 GenKaKu 账户仪表板中查看。
奖励
除了 USDC 收益外,工作者还可根据服务质量获得 $GENKAKU 奖励。奖励公式考虑以下多个表现因素:
提升奖励的表现指标:
- 每秒输出 tokens 数——GPU 越快,生成的 tokens 越多,获得的奖励越高
- 低延迟——工作者与编排器之间的响应时间越短
- 正常运行时间——保持在线且可用的时间越长
- 任务完成率——成功完成任务,无错误或超时
- 连线稳定性——持续、可靠的网络连接
- 稳定性——持续稳定的表现,而非间歇性突发
降低奖励的因素:
- 任务中途断线
- 每秒输出 tokens 数过低
- 高延迟或不稳定网络
- 任务失败或超时
- 频繁断线
空置奖励: 即使没有分配任务,保持在线也能获得少量 $GENKAKU 奖励——网络奖励那些维持容量并随时准备服务的工作者。
图像工作者
图像是工作者的一种类型:独立 GPU 运行 ComfyUI 用于图像生成。它既作为文本模型可以调用的 generate_image 工具,也作为图像 API 提供——无论哪种方式,都由图像工作者渲染结果。
任务路由
| 通道 | 工作者类型 | 模型 |
|---|---|---|
聊天 + qwen3.8-27b-uncensored | 桌面工作者(Ollama) | Qwen3.8 27B Uncensored |
| 图像生成 | ComfyUI | Chroma1-HD |
工作者选择
当任务准备就绪时,编排器会查看服务所请求模型的空闲工作者,并通过加权随机选择选中一个。每个工作者的权重是其测量的平均令牌/秒(设有下限,使最慢的工作者仍能获得一些流量)。更快的工作者获得更多任务,但工作和收益会分布在整个池中,而不仅仅落在单个最快的工作者上。
网络搜索
网络搜索是模型驱动的。模型自身决定是否调用 web_search 工具。当它调用时,编排器运行搜索(Brave Search API),将结果作为工具结果反馈给模型,模型从中继续——这是一次往返,而非预取。然后模型会基于真实、最新的网络内容进行响应并引用其来源。
令牌流式传输
响应以实时方式流式传输。当工作者生成每个令牌时,它会立即通过编排器发送给用户。无需等待完整响应——你实时看到它被写入,就像任何其他聊天 AI 一样,只是计算是在网络另一端的某个人的 GPU 上进行的。