소스 정보
- 저장소
- arm2arm/AstroAgentAssistant
- 최근 소스 활동
- 2026년 8월 26일 12:28
- 감지된 SKILL.md 언어
- 영어
- 스타
- 4
- 포크
- 1
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/arm2arm/AstroAgentAssistant --skill local-llm-setup명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SKILL.md 표시 중
| name | local-llm-setup |
| description | Diagnose local LLMs, bridge formats for Claude Code, Codex. |
| version | 1.0.0 |
| author | Hermes Agent |
| license | MIT |
| platforms | ["linux","macos","windows"] |
| metadata | {"hermes":{"tags":["Coding-Agent","Local-LLM","Setup","Troubleshooting","Proxy"]}} |
When a user wants a coding agent (Claude Code, Codex, OpenCode) running on a local/self-hosted LLM.
curl -s https://<host>/v1/models \
-H "Authorization: Bearer <key>"
Expected: {"data":[{"id":"<model-name>"}],"object":"list"}
curl -s -X POST https://<host>/v1/chat/completions \
-H "Authorization: Bearer <key>" \
-H "Content-Type: application/json" \
-d '{"model":"<model>","messages":[{"role":"user","content":"hi"}],"max_tokens":20}'
| Result | Meaning |
|---|---|
| 200 OK | OpenAI-compatible, coding agent may work |
| 405 Method Not Allowed | Models endpoint works but chat completions not served — agent WILL fail |
| 404 | Wrong path, service down, or incomplete API |
A models endpoint returning 200 does NOT mean the service is ready for Claude Code. Always test /v1/chat/completions.
If the endpoint speaks OpenAI (/v1/chat/completions) but Claude Code needs Anthropic format:
pip install litellm
litellm --model openai/<provider>/<model> --host <host> --port 4000
Then:
ANTHROPIC_API_KEY=*** \
ANTHROPIC_BASE_URL=http://127.0.0.1:4000/v1/messages \
claude -p "task" --max-turns 1
Point the agent directly at the local endpoint using environment variables:
ANTHROPIC_API_KEY=*** ANTHROPIC_BASE_URL=<host>/v1OPENAI_API_KEY=*** OPENAI_BASE_URL=<host>/v1--model <provider>/<model> with appropriate authANTHROPIC_API_KEY can be any string for local endpoints — it just needs to be present for auth validation--max-turns 1 for smoke tests/v1/models but not /v1/chat/completions is misconfigured — Claude Code cannot use it. Fix the upstream or add a proxy.--sandbox danger-full-access for Codex or --bare for Claude Codeollama pull <model-name>
ollama list | grep <model-name> # verify
import yaml
with open('/home/hermes/.hermes/config.yaml', 'r') as f:
config = yaml.safe_load(f)
# Add model to provider's model list (don't overwrite)
models = config['providers']['ollama'].setdefault('models', [])
if '<model-name>' not in models:
models.append('<model-name>')
with open('/home/hermes/.hermes/config.yaml', 'w') as f:
yaml.dump(config, f, default_flow_style=False, sort_keys=False, allow_unicode=True)
hermes config set model.provider ollama
hermes config set model.default <model-name>
import requests, time, json
payload = {
"model": "<model-name>",
"prompt": "List 50 items quickly.",
"stream": True,
"options": {"temperature": 0.7, "num_predict": 80}
}
resp = requests.post("http://localhost:11434/api/generate", json=payload, stream=True, timeout=300)
tokens_count = 0
start = time.time()
ttft = None
for line in resp.iter_lines():
if line:
chunk = json.loads(line)
if "response" in chunk:
tokens_count += 1
if ttft is None:
ttft = time.time() - start
elapsed = time.time() - start
tps = tokens_count / elapsed
print(f"TTFT: {ttft:.1f}s | Tokens: {tokens_count} | Time: {elapsed:.1f}s | TPS: {tps:.1f}")
Expected TPS: ~10-15 on CPU for 27B models (no GPU). 2-4x faster per token on GPU.
model.default — it may still point to the removed model. Switch it back to a valid one.ollama pull can take a long time for large models (17GB+). Set generous timeouts./v1/completions endpoint may timeout for generation — use /api/generate with stream: True for reliable measurement.ollama --version and GitHub releases. Stable lags behind.dflash quants in Ollama 0.32.7 work only on the MLX engine (Apple Silicon). CUDA/ROCm/Linux ARM64 returns 412 even on latest stable. Check release notes for "coming days" disclaimers before installing pre-release builds. Always check available tags at https://ollama.com/library/<model>/tags — non-MLX tags (e.g., q4_K_M, q8_0, bf16) usually work cross-platform immediately.claude-code skill for Claude Code orchestration patternscodex skill for Codex workflow patterns