要跑翻譯但本機 Sakura 模型伺服器沒起來(translate.py 回報 /health 失敗)時,啟動並確認 llama-server;翻譯端(dgxluna)限定。
Install
npx skillscat add st70712/galtransl-agent-tools/start-translator Install via the SkillsCat registry.
SKILL.md
/start-translator
觸發
tools/translate.py 印出「llama-server 未啟動」、curl http://127.0.0.1:8080/health 失敗,或使用者說模型關掉了。
只有翻譯端(dgxluna)能跑;實機端沒有模型,翻譯要 /handoff 交過去。
輸入
- 無;預設值在
config.yaml(llama_server_bin、model_gguf、endpoint、llama_ctx、llama_np、llama_gpu),config.local.yaml可覆蓋。
步驟
bash tools/llama_server.sh status # pid / health / 模型名
bash tools/llama_server.sh start # nohup 背景啟動 + 等 health ok;已在跑則只印 status
bash tools/llama_server.sh start --gpu 3 --ctx 32768 --np 16 # 指定卡;預設 auto 挑用量最低的卡
bash tools/llama_server.sh wait --timeout 300
bash tools/llama_server.sh stop # 用 pid 檔停;備援掃 /proc,絕不 pkill -fstart是同步的(含等待),可以直接前景跑;模型載入約 1–2 分鐘。- 失敗看
logs/llama-server.log;常見:GPU 被別人的 vLLM 占滿(換--gpu)、port 被占(換--port並在 translate.py 用-e)。 - 模型:
Sakura-GalTransl-14B-v3.8.gguf,OpenAI 相容 APIhttp://127.0.0.1:8080/v1,模型型別galtransl-v3。
輸出
/health回 ok、/v1/models列出模型;translate.py 可連。
停下來問使用者
- 所有 GPU 都被占用、或需要停掉別人的行程時——不要自己殺。