跳到主要内容

GenKaKu 工作原理

流程

用户 → 编排器 → 工作者 → 令牌流式回传 → 用户
  1. 你从 genkaku.app 聊天界面发送一条消息
  2. 编排器接收你的请求,并找到一个能运行所需模型的工作者
  3. 工作者在其 GPU 上执行推理,并通过编排器将令牌流式回传
  4. 你实时看到响应逐词出现

编排器

编排器是一个使用 Socket.io 进行实时通信的 Node.js 服务器。它处理:

  • 认证——通过 Privy 验证用户和工作者
  • 任务队列——管理传入请求并将其匹配给可用工作者
  • 工作者注册表——跟踪哪些工作者在线、它们的能力和当前负载
  • 路由——将任务定向到正确的工作者类型以运行请求的模型
  • 工作者选择——选择哪个空闲工作者接收任务(按测量的令牌/秒加权随机选择)
  • 工具调用——当模型请求时运行网络搜索,并将结果反馈
  • 统计信息——每 5 秒广播一次实时网络统计

编排器不存储对话。它路由流量然后继续处理下一个。

工作者

工作者是在你的机器上运行的桌面应用程序,为 GenKaKu 网络提供推理服务。下载 GenKaKu Worker 应用,登录,你的 GPU 就开始赚取收益——无需命令行设置。

工作者底层使用 Ollama 提供模型服务,支持 CUDA(NVIDIA)、Metal(Apple Silicon)和 Vulkan(AMD/Intel)加速。它运行 Qwen3.8 27B Uncensored——网络的主要文本模型——处理路由到它的所有聊天消息和 API 请求。

硬件要求:16GB 以上 NVIDIA GPU(推荐 24GB)、24GB 以上 AMD 显卡或 32GB 以上 Apple Silicon Mac。性能因硬件而异,但在合适的 GPU 上可达 25+ 令牌/秒。

不提供服务时,工作者在后台空闲运行。你也可以使用小组件模式——一个紧凑的浮层,一目了然地显示 GPU 利用率、USDC 收入和 $GENKAKU 收益。内置的教学助手由本地 Ollama 模型驱动,帮助你无需离开应用即可排除故障。

如何连接

  1. 打开 GenKaKu Worker 应用并使用你的 GenKaKu 账户登录
  2. 应用向编排器注册并宣布你的 GPU 能力
  3. 当你的工作者空闲且模型匹配请求时,编排器将任务路由到你的工作者
  4. 你的 GPU 执行推理并通过编排器流式回传令牌
  5. 你为完成的每个任务赚取 USDC——在应用的仪表板中可见

收益

工作者按完成的工作量比例赚取 USDC。费率取决于所提供的模型和当前的网络需求。收益实时累积,可在桌面应用和 GenKaKu 账户仪表板中查看。

奖励

除了 USDC 收益外,工作者还可根据服务质量获得 $GENKAKU 奖励。奖励公式考虑以下多个表现因素:

提升奖励的表现指标:

  • 每秒输出 tokens 数——GPU 越快,生成的 tokens 越多,获得的奖励越高
  • 低延迟——工作者与编排器之间的响应时间越短
  • 正常运行时间——保持在线且可用的时间越长
  • 任务完成率——成功完成任务,无错误或超时
  • 连线稳定性——持续、可靠的网络连接
  • 稳定性——持续稳定的表现,而非间歇性突发

降低奖励的因素:

  • 任务中途断线
  • 每秒输出 tokens 数过低
  • 高延迟或不稳定网络
  • 任务失败或超时
  • 频繁断线

空置奖励: 即使没有分配任务,保持在线也能获得少量 $GENKAKU 奖励——网络奖励那些维持容量并随时准备服务的工作者。

图像工作者

图像是工作者的一种类型:独立 GPU 运行 ComfyUI 用于图像生成。它既作为文本模型可以调用的 generate_image 工具,也作为图像 API 提供——无论哪种方式,都由图像工作者渲染结果。

任务路由

通道工作者类型模型
聊天 + qwen3.8-27b-uncensored桌面工作者(Ollama)Qwen3.8 27B Uncensored
图像生成ComfyUIChroma1-HD

工作者选择

当任务准备就绪时,编排器会查看服务所请求模型的空闲工作者,并通过加权随机选择选中一个。每个工作者的权重是其测量的平均令牌/秒(设有下限,使最慢的工作者仍能获得一些流量)。更快的工作者获得更多任务,但工作和收益会分布在整个池中,而不仅仅落在单个最快的工作者上。

网络搜索

网络搜索是模型驱动的。模型自身决定是否调用 web_search 工具。当它调用时,编排器运行搜索(Brave Search API),将结果作为工具结果反馈给模型,模型从中继续——这是一次往返,而非预取。然后模型会基于真实、最新的网络内容进行响应并引用其来源。

令牌流式传输

响应以实时方式流式传输。当工作者生成每个令牌时,它会立即通过编排器发送给用户。无需等待完整响应——你实时看到它被写入,就像任何其他聊天 AI 一样,只是计算是在网络另一端的某个人的 GPU 上进行的。