
更新了一版本,测试两周没问题
殷玉达
-
基于AI做一个一套Linux环境下的推理服务控制面板 -
基于Codex开发的电报群管机器人
-
基于Codex开发的电报群管机器人TG-Go-BOT
早期以Hermes开发,后期通过Pi和Codex迭代,用五个群进行了测试,对比目前的其他机器人,反垃圾广告强很多,配置了AI作为最后无法识别的兜底。
Telegram 群组治理机器人、Control API 和 Vue 3 管理控制台。
项目包含三部分:
Go 机器人执行面:消息审核、规则判定、投票、处罚、申诉、白名单和 Agent 对话。
本机 Control API:提供模块能力、配置、运行状态、模型中心和 Agent 契约。
Vue 3 管理控制台:通过认证 BFF 管理群组、规则、模型和运行观测。
特性
分层审核管线:归一化、规则、行为、相似度、模型和人工复核协同工作。
有界并发、持久化副作用队列、重试和运行观测,避免 Telegram API 波动阻塞收包。
群组策略、白名单、申诉和处罚状态统一由机器人与 Control API 管理。
模型渠道、Agent 场景和服务端密钥通过服务端配置管理;密钥不进入前端或 Git。
管理控制台默认要求认证,开发时也可以显式启用本地不安全模式。
快速开始
要求:Go 1.22+、Node.js 20+、npm。git clone https://github.com/coolwolfqs/tg-go-bot.git
cd tg-go-bot
cp .env.example .env
编辑 .env,填入 BOT_TOKEN 和其他本地配置
set -a
. ./.env
set +a
go run ./cmd/bot
构建并启动控制台:cd dashboard
npm ci
npm run build
BOT_DATA_DIR=../data DASHBOARD_ALLOW_INSECURE_LOCAL=1 node server/index.js
生产环境必须设置 DASHBOARD_AUTH_TOKEN、CONTROL_API_TOKEN,并通过 systemd EnvironmentFile、容器 Secret 或其他受控密钥系统注入凭据。不要把 .env、运行时 JSON、日志、聊天数据或模型密钥提交到 Git。 -
基于AI做一个一套Linux环境下的推理服务控制面板没学过编程,通过两个多月的迭代基本能够满足需求,就发布出来,全程hermes。
往论坛内各位多提意见,我继续完善。
https://github.com/coolwolfqs/llm-inference-monitor -
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)这两参数你调大一点
BATCH="512"
UBATCH="256"
ctx 128K或者64K
K V的压缩尽量统一参数 turbo3 就可以
20g很容易oom,可以去huggface找找小一点的包,没有MTP 35A3B性能就不错 -
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)殷玉达 说:
参数信息
Qwen3.6-35B-A3B-MXFP4_MOE-MTP.gguf
ctx=192K
ngl=99
并发=2
GPU=3080+3060
TS=70,30
K=turbo3
V=turbo3
dK=turbo3
dV=turbo3
MTP=2
b=1024
ub=512
FA=on
t=8
temp=0.7官方turboquant还没合并分支,我自己合并的,测试了几天基本没什么bug,你可以试试,早上刚合并9222也正常
-
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)参数信息
Qwen3.6-35B-A3B-MXFP4_MOE-MTP.gguf
ctx=192K
ngl=99
并发=2
GPU=3080+3060
TS=70,30
K=turbo3
V=turbo3
dK=turbo3
dV=turbo3
MTP=2
b=1024
ub=512
FA=on
t=8
temp=0.7 -
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)
我是3080 20G OCULINK +3060 12G 雷电3 基本能跑到100左右 -
RTX 3080 20GB 上以 256k / ~45 tk/s 运行 Qwen3.6-35B-A3B-Q4-K-M(ubuntu)按3080的理论速度是可以到100以上啊