用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/aAAaqwq/AGI-Super-Team --skill remote-ollama-gpu-scheduler命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
币安广场合约投机雷达 v5:以最近24小时专业交易帖为主要证据,回源核验帖子, 联合币安公共合约行情、4周期K线、布林带、ATR、量能和RR,生成可审计的本地影子报告。 触发词:币安广场、扫描币安、binance square、合约机会、交易信号雷达、4小时雷达
BTC 5分钟K线实时方向预测。v5.9对抗式审查重构: 13因子收敛到3个有证据信号(half_body延续+volume放量+meanrev回归, 11个47-49%硬币因子清零) + 三层独立信息过滤(多周期4h/1h/15m趋势 + 跨资产ETH/SOL广度 + 真订单流OFI) + 移除bull×0.92惩罚/Platt置信度门控。半K线策略第2分钟执行。黑天鹅防护: ATR spike+FNG<25。Binance端点双向故障切换。
BB 双向套利策略:加密合约 10x 杠杆布林带均值回归。布林带收窄=横盘→在下轨买、上轨卖;三重过滤器(1h趋势/RSI/BB甜区)确认碗平放,轨对轨止盈(RR 2:1~4:1)。含实时WebSocket模拟盘(paper)、历史回测(simulate/backtest_daily)、币安永续实盘CLI(trade_exec)。触发:'bb套利'、'布林带'、'bollinger'、'横盘策略'、'NEAR'、'回测'、'模拟盘'、'paper trading'。
基于 SOC 职业分类
正在显示 SKILL.md
| name | remote-ollama-gpu-scheduler |
| description | 调度远程 Ollama GPU 资源执行批量 embedding 或推理任务,提升多机环境下的算力利用率。 |
高效调度远程 Ollama GPU 算力进行批量 embedding 的技能。
Node.js fetch 不尊重 NO_PROXY,导致 Tailscale 流量被本地代理拦截:
# ❌ 这样没用!Node 忽略 NO_PROXY
NO_PROXY=100.0.0.0/8 node -e "fetch('http://100.x.x.x:11434')..."
# ✅ 必须清空全局代理变量
unset HTTP_PROXY HTTPS_PROXY http_proxy https_proxy
# 或用 undici 的 setGlobalDispatcher 绕过
┌─────────┐ Tailscale ┌────────────┐
│ Linux │ ───────────────▶ │ Mac Studio │
│ QMD │ NO_PROXY │ Ollama │
│ │ 100.0.0.0/8 │ 0.6b/8b │
└─────────┘ └────────────┘
配置:
export QMD_EMBED_BACKEND=ollama
export QMD_OLLAMA_EMBED_URL=http://100.65.110.126:11434
export QMD_OLLAMA_EMBED_MODEL=qwen3-embedding:0.6b # 或 :8b
性能:
┌─────────┐ Tailscale ┌────────────┐
│ Linux │ ───────────────▶ │ Mac Studio │
│ QMD │ /v1/embeddings │llama-server│
│ │ OpenAI格式 │ Flash Attn│
└─────────┘ └────────────┘
配置:
export QMD_EMBED_BACKEND=llamaserver
export QMD_LLAMASERVER_URL=http://100.65.110.126:8081
export QMD_LLAMASERVER_CONCURRENCY=4
已知问题:
GGML_ASSERT(i01 >= 0 && i01 < ne01) failed--parallel 1 或换 llama.cpp b8200# 0.6b 模型路径
MODEL=/Users/daniel/.ollama/models/blobs/sha256-06507c7b42688469c4e7298b0a1e16deff06caf291cf0a5b278c308249c3e439
# 稳定配置(parallel=1)
/tmp/llama/llama-b8352/llama-server \
-m $MODEL \
--embedding \
--port 8081 \
--host 0.0.0.0 \
-ngl 99 \
--parallel 1 \
-c 4096 \
-b 512
# 激进配置(可能崩溃)⚠️
/tmp/llama/llama-b8352/llama-server \
-m $MODEL \
--embedding \
--port 8081 \
--host 0.0.0.0 \
-ngl 99 \
--parallel 8 \
-c 16384 \
-b 2048
| 后端 | 模型 | 并行度 | 速度 | 维度 | 稳定性 |
|---|---|---|---|---|---|
| Ollama | qwen3:0.6b | 1 | 2.5 c/s | 1024 | ✅ |
| Ollama | qwen3:8b | 1 | 1.1 c/s | 4096 | ✅ |
| llama-server | 0.6b | 1 | ~15 c/s* | 1024 | ⚠️ |
| llama-server | 0.6b | 8 | ~120 c/s* | 1024 | ❌ crash |
*估算值,实际测试中 parallel>1 会崩溃
在 /path/to/qmd/dist/llm.js 添加 llamaserver 后端:
// --- llama-server Backend (OpenAI-compatible) ---
const _LLAMASERVER_URL = process.env.QMD_LLAMASERVER_URL || "";
const _LLAMASERVER_CONCURRENCY = parseInt(process.env.QMD_LLAMASERVER_CONCURRENCY || "4", 10);
async function _llamaserverEmbed(text) {
const url = `${_LLAMASERVER_URL}/v1/embeddings`;
const resp = await fetch(url, {
method: "POST",
headers: { "Content-Type": "application/json" },
body: JSON.stringify({ model: "qwen3-embedding", input: text }),
signal: AbortSignal.timeout(300000),
});
const data = await resp.json();
const vec = data?.data?.[0]?.embedding;
return vec ? { embedding: vec, model: "llamaserver:qwen3" } : null;
}
async function _llamaserverEmbedBatch() {
= _LLAMASERVER_CONCURRENCY;
subSize = .(texts. / );
subBatches = [];
( i = ; i < texts.; i += subSize) {
subBatches.(texts.(i, i + subSize));
}
results = .(subBatches.( (batch) => {
resp = (, {
: ,
: { : },
: .({ : , : batch }),
: .(),
});
data = resp.();
(data?. || []).( a. - b.)
.( d. ? { : d., : } : );
}));
results.();
}
# 检查代理
env | grep -i proxy
# 检查 Tailscale
tailscale status | grep studio
# 测试直连
curl --noproxy "*" http://100.65.110.126:11434/api/tags
Error: dimension mismatch (expected 4096, got 1024)
解决: qmd embed -f 强制重建索引
# 查看崩溃日志
tail -20 /tmp/llama-server.log | grep -E 'ASSERT|exception|abort'
# 降级参数
--parallel 1 -c 4096 -b 512
稳定优先: 用 Ollama backend + 0.6b 模型
export QMD_EMBED_BACKEND=ollama
export QMD_OLLAMA_EMBED_URL=http://100.65.110.126:11434
export QMD_OLLAMA_EMBED_MODEL=qwen3-embedding:0.6b
速度优先: 等待 llama.cpp 修复后使用 llamaserver backend
创建日期: 2026-03-15 适用场景: 批量 embedding、知识库构建、向量搜索