Qualify and enable MTP 2 with paired workload evidence and fallback
This commit is contained in:
@@ -1,6 +1,6 @@
|
|||||||
# Qwen3.8 Flash-Next on RTX 6000D
|
# Qwen3.8 Flash-Next on RTX 6000D
|
||||||
|
|
||||||
2026-09-18 已完成部署和验收。保留文字、图片、视频能力;采用 NVIDIA NVFP4 权重、原生 FP8 PLE 主机内存卸载、FP8 KV、128K 上下文及 FULL CUDA Graph。单个活动请求,MTP 暂不启用。
|
2026-09-18 已完成部署和验收。保留文字、图片、视频能力;采用 NVIDIA NVFP4 权重、原生 FP8 PLE 主机内存卸载、FP8 KV、128K 上下文及 FULL CUDA Graph。单个活动请求,**MTP 2 已通过扩展配对验证并启用**,GPU 预算为 0.985。
|
||||||
|
|
||||||
社区代码经过审计后仅作为参考,没有执行社区启动脚本或使用社区镜像。审计范围和取舍见 [源码审计](audit/source-review.md),实测数据见 [验收结果](audit/results.md)。
|
社区代码经过审计后仅作为参考,没有执行社区启动脚本或使用社区镜像。审计范围和取舍见 [源码审计](audit/source-review.md),实测数据见 [验收结果](audit/results.md)。
|
||||||
|
|
||||||
@@ -8,7 +8,8 @@
|
|||||||
|
|
||||||
- `compose.yaml`、`Dockerfile`:已验收部署配置与固定镜像。
|
- `compose.yaml`、`Dockerfile`:已验收部署配置与固定镜像。
|
||||||
- `patches/`:最小补丁、精确源码保护及许可证。
|
- `patches/`:最小补丁、精确源码保护及许可证。
|
||||||
- [MTP 实测](docs/mtp-test.md):约 1.93 倍短输出吞吐,需要更高显存预算,暂不设为默认。
|
- [MTP 完整验证](docs/mtp-qualification.md):长解码提升约 58%–67%,98 个负载请求及两组各 7 个质量任务通过;包含缓存延迟取舍。
|
||||||
|
- [MTP 初测记录](docs/mtp-test.md):历史短测试和当时的暂缓决定,已由完整验证更新。
|
||||||
- [部署心得](docs/lessons.md):取舍、踩坑、优化方向及升级方法。
|
- [部署心得](docs/lessons.md):取舍、踩坑、优化方向及升级方法。
|
||||||
- `scripts/`:功能、上下文、速度和资源验证工具。
|
- `scripts/`:功能、上下文、速度和资源验证工具。
|
||||||
- `audit/runtime/`:2026-09-18 历史原始回执,不代表实时状态。
|
- `audit/runtime/`:2026-09-18 历史原始回执,不代表实时状态。
|
||||||
@@ -30,7 +31,7 @@ cd /data/flash-next/project
|
|||||||
python3 - <<'PY'
|
python3 - <<'PY'
|
||||||
import json, urllib.request
|
import json, urllib.request
|
||||||
from pathlib import Path
|
from pathlib import Path
|
||||||
body = {'model': 'qwen3.8-flash-next', 'messages': [{'role': 'user', 'content': '你好,请介绍一下自己。'}], 'max_tokens': 1024, 'reasoning_effort': 'low'}
|
body = {'model': 'qwen3.8-flash-next', 'messages': [{'role': 'user', 'content': '你好,请介绍一下自己。'}], 'max_tokens': 1024, 'reasoning_effort': 'medium'}
|
||||||
req = urllib.request.Request('http://127.0.0.1:8000/v1/chat/completions', data=json.dumps(body).encode(), headers={'Content-Type': 'application/json', 'Authorization': 'Bearer '+Path('secrets/api-key').read_text().strip()})
|
req = urllib.request.Request('http://127.0.0.1:8000/v1/chat/completions', data=json.dumps(body).encode(), headers={'Content-Type': 'application/json', 'Authorization': 'Bearer '+Path('secrets/api-key').read_text().strip()})
|
||||||
print(json.load(urllib.request.urlopen(req, timeout=180)))
|
print(json.load(urllib.request.urlopen(req, timeout=180)))
|
||||||
PY
|
PY
|
||||||
@@ -73,4 +74,8 @@ python3 scripts/long_context.py --tokens 128000 --output /data/flash-next/audit/
|
|||||||
python3 scripts/benchmark.py --output /data/flash-next/audit/benchmark-new.jsonl
|
python3 scripts/benchmark.py --output /data/flash-next/audit/benchmark-new.jsonl
|
||||||
```
|
```
|
||||||
|
|
||||||
脚本拒绝覆盖同名结果。长上下文验证为固定位置检索及前缀复用;多模态验证为合成图片和短视频;不代表综合质量评测或长期压力测试。当前基线优先单请求和多模态能力,额外并发、MTP、更长视频应另行测试。
|
脚本拒绝覆盖同名结果。长上下文验证为固定位置检索及前缀复用;多模态验证为合成图片和短视频;不代表综合质量评测或长期压力测试。当前基线优先单请求和多模态能力,额外并发、更大或更长的视频应另行测试。
|
||||||
|
|
||||||
|
## 默认配置与回退
|
||||||
|
|
||||||
|
当前 `compose.yaml` 为 MTP 2,实际运行器使用 FULL_DECODE_ONLY Graph。`compose.baseline.yaml` 保留无 MTP 的 0.96 GPU 预算配置。长生成优先使用 MTP;大上下文反复短问答可能更适合无 MTP,因为可复用 KV 容量更大。切换方法和完整证据见 [MTP 完整验证](docs/mtp-qualification.md)。
|
||||||
|
|||||||
@@ -0,0 +1,33 @@
|
|||||||
|
{"name": "arithmetic-0", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 141, "completion_tokens": 82, "completion_tokens_details": {"reasoning_tokens": 75}}, "ttft_s": 0.07772354000007908, "elapsed_s": 1.149622212000395, "decode_tps": 75.5668442510918, "max_stream_gap_s": 0.03973271099948761, "events": 79, "content": "\n\n3973", "reasoning": "I need to compute 137 * 29 + 0.\n\n137 * 29 = 137 * 30 - 137 = 4110 - 137 = 3973\n\nAdding 0 doesn't change anything, so the answer is 3973.\n", "sha256": "d929fd317464b07ece811a135b5937af8eb36ea0b1e88ec82bc5137102d0a62c"}
|
||||||
|
{"name": "arithmetic-1", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 96, "completion_tokens": 37, "completion_tokens_details": {"reasoning_tokens": 30}}, "ttft_s": 0.07883534699976735, "elapsed_s": 0.5551211570000305, "decode_tps": 75.58486783383303, "max_stream_gap_s": 0.03967835599996761, "events": 34, "content": "\n\n5761", "reasoning": "160 * 36 = 5760. 5760 + 1 = 5761.\n", "sha256": "5cd050422245af84010bf1c71082001dcd6d880bdd6dd7002e69a8402ab6c73c"}
|
||||||
|
{"name": "arithmetic-2", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 125, "completion_tokens": 66, "completion_tokens_details": {"reasoning_tokens": 59}}, "ttft_s": 0.07831667499976902, "elapsed_s": 0.9377429689993733, "decode_tps": 75.63184935557712, "max_stream_gap_s": 0.039701828999568534, "events": 63, "content": "\n\n7871", "reasoning": "183 * 43 = 183 * 40 + 183 * 3 = 7320 + 549 = 7869. Then 7869 + 2 = 7871.\n", "sha256": "c6dabe0673abae92ebdac3d245deb7c9ca89c874d316c46b8ce09fde923a752f"}
|
||||||
|
{"name": "arithmetic-3", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 101, "completion_tokens": 42, "completion_tokens_details": {"reasoning_tokens": 34}}, "ttft_s": 0.07822468900030799, "elapsed_s": 0.6203575899999123, "decode_tps": 75.62721230237588, "max_stream_gap_s": 0.03962699600015185, "events": 39, "content": "\n\n10303", "reasoning": "206 * 50 = 10300, then 10300 + 3 = 10303.\n", "sha256": "faf8742035a51aed0549e27e042a16ddce400e4a9f6cb41b47540844a9fde0a7"}
|
||||||
|
{"name": "arithmetic-4", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 131, "completion_tokens": 72, "completion_tokens_details": {"reasoning_tokens": 64}}, "ttft_s": 0.07851739099987753, "elapsed_s": 1.017388297999787, "decode_tps": 75.62275012533416, "max_stream_gap_s": 0.039650787999562453, "events": 69, "content": "\n\n13057", "reasoning": "229 * 57 = 229 * 50 + 229 * 7 = 11450 + 1603 = 13053. Then 13053 + 4 = 13057.\n", "sha256": "5c8a761b69d32970d9e4021e9cddda2caf44a6201a9bf34e503844cd2ce1dc0c"}
|
||||||
|
{"name": "arithmetic-5", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 100, "completion_tokens": 41, "completion_tokens_details": {"reasoning_tokens": 33}}, "ttft_s": 0.07850254000004497, "elapsed_s": 0.6072512140008257, "decode_tps": 75.6503079191475, "max_stream_gap_s": 0.039656347000345704, "events": 38, "content": "\n\n16133", "reasoning": "252 * 64 = 16128. 16128 + 5 = 16133.\n", "sha256": "d7ffeebe2bcd01af72cd619ced3e33606c067dbbcee20babfbe1aded61293b92"}
|
||||||
|
{"name": "arithmetic-6", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 130, "completion_tokens": 71, "completion_tokens_details": {"reasoning_tokens": 63}}, "ttft_s": 0.07873150400064333, "elapsed_s": 1.0037764430007883, "decode_tps": 75.67199932541767, "max_stream_gap_s": 0.03964858600011212, "events": 68, "content": "\n\n19531", "reasoning": "275 * 71 = 275 * 70 + 275 * 1 = 19250 + 275 = 19525. Then 19525 + 6 = 19531.\n", "sha256": "7ac565b6322b904ff447bc9ef3ed069ebc4e48b8a51e72f9e18919bd8e3000d1"}
|
||||||
|
{"name": "arithmetic-7", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 153, "completion_tokens": 94, "completion_tokens_details": {"reasoning_tokens": 86}}, "ttft_s": 0.0784115259993996, "elapsed_s": 1.3077415259995178, "decode_tps": 75.65096434642534, "max_stream_gap_s": 0.03962907900040591, "events": 91, "content": "\n\n23251", "reasoning": "298 * 78 = 298 * 78. Let me compute this step by step.\n\n298 * 78 = 298 * 80 - 298 * 2 = 23840 - 596 = 23244\n\n23244 + 7 = 23251\n", "sha256": "e7b73eb708d2c4c7d2fc5dca2aed40a571c8b0445cd1867d916b47f57ec4cac0"}
|
||||||
|
{"name": "arithmetic-8", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 144, "completion_tokens": 85, "completion_tokens_details": {"reasoning_tokens": 77}}, "ttft_s": 0.07822253599988471, "elapsed_s": 1.1883135919997585, "decode_tps": 75.6694683251367, "max_stream_gap_s": 0.03964279800038639, "events": 82, "content": "\n\n27293", "reasoning": "Let me compute 321 * 85 + 8.\n\n321 * 85 = 321 * 80 + 321 * 5 = 25680 + 1605 = 27285\n\n27285 + 8 = 27293\n", "sha256": "9d93671c15eac2005a27c4fe38e5d4285b3feca77fa1e90f138c71a2b5164db8"}
|
||||||
|
{"name": "arithmetic-9", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 59, "total_tokens": 143, "completion_tokens": 84, "completion_tokens_details": {"reasoning_tokens": 76}}, "ttft_s": 0.0801680779995877, "elapsed_s": 1.1772930710003493, "decode_tps": 75.65227346884657, "max_stream_gap_s": 0.03965692699966894, "events": 81, "content": "\n\n31657", "reasoning": "Let me compute 344 * 92 + 9.\n\n344 * 92 = 344 * 90 + 344 * 2 = 30960 + 688 = 31648\n\n31648 + 9 = 31657\n", "sha256": "6b95a8b82a4ba5a8335b5f10899663aeebe71fed7e5673836b82ec74cfa1cbee"}
|
||||||
|
{"name": "arithmetic-10", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 60, "total_tokens": 143, "completion_tokens": 83, "completion_tokens_details": {"reasoning_tokens": 75}}, "ttft_s": 0.07851070200013055, "elapsed_s": 1.1620557369997186, "decode_tps": 75.67751902442262, "max_stream_gap_s": 0.039518157000202336, "events": 80, "content": "\n\n36343", "reasoning": "Let me compute 367 * 99 + 10.\n\n367 * 99 = 367 * (100 - 1) = 36700 - 367 = 36333\n\n36333 + 10 = 36343\n", "sha256": "662f32768d742ea67e45b8109190fc2ba55c429346f4be9b9492ff457cdacc48"}
|
||||||
|
{"name": "arithmetic-11", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 61, "total_tokens": 151, "completion_tokens": 90, "completion_tokens_details": {"reasoning_tokens": 82}}, "ttft_s": 0.07955242300067766, "elapsed_s": 1.2561235120001584, "decode_tps": 75.64353810162275, "max_stream_gap_s": 0.03971186299986584, "events": 87, "content": "\n\n41351", "reasoning": "Let me compute 390 * 106 + 11.\n\n390 * 106 = 390 * 100 + 390 * 6 = 39000 + 2340 = 41340\n\n41340 + 11 = 41351\n", "sha256": "cdbf70494a3484ed891137af4bad12b7417009befd921930fc1fa5e5e3907e27"}
|
||||||
|
{"name": "json", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 66, "total_tokens": 109, "completion_tokens": 43, "completion_tokens_details": {"reasoning_tokens": 26}}, "ttft_s": 0.09644218499943236, "elapsed_s": 0.651459989999239, "decode_tps": 75.6732479960974, "max_stream_gap_s": 0.03967342000032659, "events": 40, "content": "\n\n{\"name\":\"设备A\",\"count\":7,\"enabled\":true}", "reasoning": "The user wants me to return exactly a specific JSON object with no markdown formatting. Let me provide exactly what they asked for.\n", "sha256": "2acba5868b21fa90ff7d281b66898b4ed66b6ff2f42a3d5a1d5bd11569806949"}
|
||||||
|
{"name": "multiturn", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 82, "total_tokens": 146, "completion_tokens": 64, "completion_tokens_details": {"reasoning_tokens": 52}}, "ttft_s": 0.07780361999994057, "elapsed_s": 0.9104519810007332, "decode_tps": 75.66219180961076, "max_stream_gap_s": 0.039605606999430165, "events": 61, "content": "\n\nAQUA-58321", "reasoning": "The user is asking me to recall the code they previously told me to remember. They said \"Remember the code AQUA-58321.\" and now they're asking what the code was. They want me to reply only with the code.\n", "sha256": "5a11c72c78b0b7d9d0ec352a11aa21a4fa1ea34ff915277ee160bbb83bbb1dd6"}
|
||||||
|
{"name": "image-ocr", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 3135, "total_tokens": 3315, "completion_tokens": 180, "completion_tokens_details": {"reasoning_tokens": 138}}, "ttft_s": 0.7455413950001457, "elapsed_s": 3.1262464499995986, "decode_tps": 75.18781027666661, "max_stream_gap_s": 0.03989871899921127, "events": 177, "content": "\n\nVerification code: **SPARK-82741**\n\nSum of amounts: 125 + 478 + 765 = **1368**", "reasoning": "The user wants the verification code and the sum of three amounts from the invoice image. Reading the image: Verification: SPARK-82741. Amount A: 125, Amount B: 478, Amount C: 765. Sum: 125 + 478 = 603; 603 + 765 = 1368. I need to provide a self-contained reply with the code and the sum. Reasoning should show entropy reduction—confirming each value and the arithmetic. Final answer: SPARK-82741 and 1368.\n", "sha256": "64d438bdfb6d81cbaa352b6ee35b7a538b4e46438117f85e1d529ff210e9a90d"}
|
||||||
|
{"name": "video-120s", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 12069, "total_tokens": 12183, "completion_tokens": 114, "completion_tokens_details": {"reasoning_tokens": 100}}, "ttft_s": 2.4627599759996883, "elapsed_s": 3.9740706529992167, "decode_tps": 74.76953727630898, "max_stream_gap_s": 0.040032412999607914, "events": 111, "content": "\n\nRed, Green, Blue, Yellow, Purple, White", "reasoning": "The user wants the six background colors in chronological order from the video frames. Looking at the timestamps: 0-19s RED, 20-39s GREEN, 40-59s BLUE, 60-79s YELLOW, 80-99s PURPLE, 100-119s WHITE. That's six colors. I need to reply only with the English color names, in order. No extra text.\n", "sha256": "53ddddc25a28dbc73b210512f71d35f5b4daee20506cee8470192ce5d98d945d"}
|
||||||
|
{"name": "multi-image", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 12356, "total_tokens": 12427, "completion_tokens": 71, "completion_tokens_details": {"reasoning_tokens": 60}}, "ttft_s": 1.4047450600000957, "elapsed_s": 2.3313891259995216, "decode_tps": 75.54141074059753, "max_stream_gap_s": 0.03995001000021148, "events": 68, "content": "\n\nSPARK-82741", "reasoning": "The user wants the verification code from the invoice. All four copies show the same line: \"Verification: SPARK-82741\". The instruction is to reply only with the code. So the answer is SPARK-82741. No need for elaboration.\n", "sha256": "c4d4ac93f59330deca1f3c5fe9842a60a2ac31170fdbc40f311385c571ed9024"}
|
||||||
|
{"name": "warmup-code", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.005225435999818728}
|
||||||
|
{"name": "perf-code-0", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0015374110007542185}
|
||||||
|
{"name": "perf-code-1", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0014719609998792293}
|
||||||
|
{"name": "perf-code-2", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0015831439995963592}
|
||||||
|
{"name": "warmup-chinese", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0012888200008092099}
|
||||||
|
{"name": "perf-chinese-0", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0015359890003310284}
|
||||||
|
{"name": "perf-chinese-1", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0013069549995634588}
|
||||||
|
{"name": "perf-chinese-2", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0015163429998210631}
|
||||||
|
{"name": "warmup-reasoning", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0012579570002344553}
|
||||||
|
{"name": "perf-reasoning-0", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.001492990000770078}
|
||||||
|
{"name": "perf-reasoning-1", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0012681409998549498}
|
||||||
|
{"name": "perf-reasoning-2", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0014675349993922282}
|
||||||
|
{"name": "long-output-16384", "passed": false, "error": "HTTP Error 400: Bad Request", "elapsed_s": 0.0012407340000208933}
|
||||||
|
{"name": "long-context-0", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 125995, "total_tokens": 126124, "completion_tokens": 129, "completion_tokens_details": {"reasoning_tokens": 109}}, "ttft_s": 13.898595239000315, "elapsed_s": 15.572495153999625, "decode_tps": 76.46813220613176, "max_stream_gap_s": 0.03968665800039162, "events": 126, "content": "\n\nNORTH-49273\nSOUTH-18362", "reasoning": "The user is asking me to provide the northern and southern access codes that are embedded in the data. Let me find them:\n\n1. \"The northern access code is NORTH-49273.\" - found between Item 000019 and Item 000021\n2. \"The southern access code is SOUTH-18362.\" - found between Item 002499 and Item 002501\n\nThe user wants only these two codes.\n", "sha256": "120d58d463e19b76220422b4b9e9ae6449cf6f89f796335bd1cbe86ec55dcc05"}
|
||||||
|
{"name": "long-context-1", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 125995, "total_tokens": 126112, "completion_tokens": 117, "completion_tokens_details": {"reasoning_tokens": 97}}, "ttft_s": 0.24017905600067024, "elapsed_s": 1.7552992750006524, "decode_tps": 76.56158141468335, "max_stream_gap_s": 0.03971610900043743, "events": 114, "content": "\n\nNORTH-49273\nSOUTH-18362", "reasoning": "The user is asking me to provide both the northern and southern access codes from the data provided.\n\nLooking through the data, I can find:\n- \"The northern access code is NORTH-49273.\" (appears after Item 000019)\n- \"The southern access code is SOUTH-18362.\" (appears after Item 002499)\n\nThe user wants only these two codes.\n", "sha256": "7f8768048dbe7257ce2b8a8b9aa144900f50a7a3a2eae9d79f0120f2323e42d7"}
|
||||||
|
{"name": "long-context-2", "passed": true, "finish": "stop", "usage": {"prompt_tokens": 125995, "total_tokens": 126117, "completion_tokens": 122, "completion_tokens_details": {"reasoning_tokens": 102}}, "ttft_s": 0.22724735799965856, "elapsed_s": 1.8088994879999518, "decode_tps": 76.50228372276625, "max_stream_gap_s": 0.03969127400068828, "events": 119, "content": "\n\nNORTH-49273\nSOUTH-18362", "reasoning": "The user is asking me to provide both the northern and southern access codes that are embedded in the data.\n\nLooking through the data:\n- \"The northern access code is NORTH-49273.\" (found between Item 000019 and Item 000021)\n- \"The southern access code is SOUTH-18362.\" (found between Item 002499 and Item 002501)\n", "sha256": "27006fc14e3dcb44599f4eaf64b2b32126e28e70c7dbca114c947205a75d4094"}
|
||||||
File diff suppressed because one or more lines are too long
@@ -0,0 +1,7 @@
|
|||||||
|
{"name": "invoice-extraction", "passed": true, "elapsed_s": 2.4416399859983358, "response": {"id": "chatcmpl-9ef1e6844fbb710d", "object": "chat.completion", "created": 1789740786, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"supplier\":\"North Star Ltd\",\"currency\":\"CNY\",\"total\":476,\"due_date\":\"2026-10-03\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants me to extract invoice data into JSON format. Let me parse the information:\n\n- Supplier: North Star Ltd\n- Currency: CNY\n- Rows: 3 items at 125 each = 375, 2 items at 48 each = 96\n- Shipping: 20\n- Discount: 15\n- Total: 375 + 96 + 20 - 15 = 476\n- Due date: 2026-10-03\n\nThe total must be an integer: 476\n\nLet me format as JSON with keys: supplier, currency, total, due_date.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 90, "total_tokens": 273, "completion_tokens": 183, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 148}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "deduplicate", "passed": true, "elapsed_s": 3.6378728710042196, "response": {"id": "chatcmpl-aebe6528b7dfdb4a", "object": "chat.completion", "created": 1789740789, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "Let me process the orders step by step.\n\nInput orders:\n1. A pending 12\n2. B paid 20\n3. A paid 15\n4. C cancelled 99\n5. D paid 8\n6. B paid 25\n\nStep 1: Keep the last occurrence of each ID.\n- A: last occurrence is \"A paid 15\" (order 3)\n- B: last occurrence is \"B paid 25\" (order 6)\n- C: last occurrence is \"C cancelled 99\" (order 4)\n- D: last occurrence is \"D paid 8\" (order 5)\n\nStep 2: Discard cancelled orders.\n- C is cancelled, so discard it.\n- Remaining: A paid 15, B paid 25, D paid 8\n\nStep 3: Sort IDs alphabetically.\n- A, B, D\n\nStep 4: Calculate total.\n- 15 + 25 + 8 = 48\n\nOutput: {\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 78, "total_tokens": 342, "completion_tokens": 264, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 247}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "schedule", "passed": true, "elapsed_s": 4.258343130997673, "response": {"id": "chatcmpl-80e60d150fade4f6", "object": "chat.completion", "created": 1789740792, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"earliest_finish\": 10, \"critical_path\": [\"A\", \"B\", \"D\"]}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "Let me analyze this scheduling problem carefully.\n\nJobs and their durations:\n- A: 3 hours (starts at hour 0)\n- B: 5 hours, starts after A (so starts at hour 3, finishes at hour 8)\n- C: 4 hours, starts after A (so starts at hour 3, finishes at hour 7)\n- D: 2 hours, starts after both B and C (so starts at max(8, 7) = 8, finishes at hour 10)\n\nLet me trace the timeline:\n- Hour 0: A starts\n- Hour 3: A finishes. B and C can start.\n- Hour 3: B starts, C starts\n- Hour 7: C finishes\n- Hour 8: B finishes. D can start (both B and C are done).\n- Hour 8: D starts\n- Hour 10: D finishes\n\nEarliest finish: 10 hours\n\nCritical path: The longest path through the dependency graph.\n- A → B → D: 3 + 5 + 2 = 10 hours\n- A → C → D: 3 + 4 + 2 = 9 hours\n\nThe critical path is A → B → D, which is [\"A\", \"B\", \"D\"].\n\nThe output should be JSON with earliest_finish and critical_path.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 68, "total_tokens": 391, "completion_tokens": 323, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 298}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "chinese-policy", "passed": true, "elapsed_s": 2.5289165139984107, "response": {"id": "chatcmpl-a468fc20ce7b6692", "object": "chat.completion", "created": 1789740797, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"甲\":\"主管\",\"乙\":\"经理\",\"丙\":\"经理\",\"丁\":\"总监\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "让我仔细分析这个审批制度:\n\n- 金额不超过5000元:主管审批\n- 超过5000且不超过20000:经理审批\n- 超过20000:总监审批\n- 加急不改变审批人\n\n现在分析每个申请:\n\n甲:5000元 → 不超过5000 → 主管\n乙:5001元加急 → 超过5000且不超过20000 → 经理(加急不改变审批人)\n丙:20000元 → 超过5000且不超过20000 → 经理\n丁:20001元 → 超过20000 → 总监\n\n输出JSON格式。\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 106, "total_tokens": 296, "completion_tokens": 190, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 170}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "merge-intervals", "passed": true, "validation_stdout": "passed\n", "validation_stderr": "", "response": {"id": "chatcmpl-981b9ed8509e7638", "object": "chat.completion", "created": 1789740799, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"code\": \"def merge_intervals(intervals):\\n if len(intervals) == 0:\\n return []\\n sorted_intervals = sorted(intervals)\\n merged = [list(sorted_intervals[0])]\\n for i in range(1, len(sorted_intervals)):\\n current = sorted_intervals[i]\\n last = merged[len(merged) - 1]\\n if current[0] <= last[1]:\\n last[1] = max(last[1], current[1])\\n else:\\n merged.append(list(current))\\n return merged\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants a Python function `merge_intervals` that merges overlapping integer intervals, including touching endpoints. Let me think about the requirements:\n\n1. Merge overlapping integer intervals, including touching endpoints (e.g., [1,3] and [3,5] should merge to [1,5])\n2. Return sorted merged intervals as lists\n3. Reply ONLY a JSON object with a code string\n4. No imports, type annotations, decorators, top-level statements or helper functions\n5. Allowed builtins: sorted, len, range, min, max, list, enumerate, sum\n6. Allowed methods: append, sort, copy\n\nLet me write the function:\n\n```python\ndef merge_intervals(intervals):\n if len(intervals) == 0:\n return []\n sorted_intervals = sorted(intervals, key=lambda x: x[0])\n merged = [list(sorted_intervals[0])]\n for i in range(1, len(sorted_intervals)):\n current = sorted_intervals[i]\n last = merged[len(merged) - 1]\n if current[0] <= last[1]: # touching or overlapping\n last[1] = max(last[1], current[1])\n else:\n merged.append(list(current))\n return merged\n```\n\nWait, I need to check: can I use `lambda`? The constraint says no imports, type annotations, decorators, top-level statements or helper functions. Lambda isn't explicitly forbidden. But let me check if `sorted` with `key` is allowed - `sorted` is in the allowed builtins.\n\nActually, let me reconsider. The constraint says \"Allowed builtins: sorted,len,range,min,max,list,enumerate,sum\". This means I can only use these builtins. `lambda` is not a builtin, it's a keyword. Let me think if I can use it...\n\nActually, `lambda` is a keyword expression, not a builtin function. The restriction is on builtins. But to be safe, let me avoid lambda and use a different approach.\n\nI can sort by using `sorted(intervals)` which sorts by first element then second element by default for lists. That should work for intervals.\n\nLet me also check: `list()` is allowed as a builtin. `append` and `sort` are allowed methods.\n\nLet me also make sure I'm not using any helper functions. The function itself is the only function.\n\n```python\ndef merge_intervals(intervals):\n if len(intervals) == 0:\n return []\n sorted_intervals = sorted(intervals)\n merged = [list(sorted_intervals[0])]\n for i in range(1, len(sorted_intervals)):\n current = sorted_intervals[i]\n last = merged[len(merged) - 1]\n if current[0] <= last[1]:\n last[1] = max(last[1], current[1])\n else:\n merged.append(list(current))\n return merged\n```\n\nThis should work. `sorted(intervals)` will sort lists lexicographically, which means by first element, then by second element. That's exactly what we need.\n\nNow I need to return this as a JSON object with a \"code\" string. Let me format it properly.\n\nThe JSON should be: {\"code\": \"def merge_intervals(intervals):\\n if len(intervals) == 0:\\n return []\\n sorted_intervals = sorted(intervals)\\n merged = [list(sorted_intervals[0])]\\n for i in range(1, len(sorted_intervals)):\\n current = sorted_intervals[i]\\n last = merged[len(merged) - 1]\\n if current[0] <= last[1]:\\n last[1] = max(last[1], current[1])\\n else:\\n merged.append(list(current))\\n return merged\"}\n\nLet me double-check: no imports, no type annotations, no decorators, no top-level statements, no helper functions. Only uses sorted, len, range, max, list, append. All allowed. Good.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 81, "total_tokens": 1090, "completion_tokens": 1009, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 877}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "binary-search", "passed": true, "validation_stdout": "passed\n", "validation_stderr": "", "response": {"id": "chatcmpl-aeb2774a80c34bf9", "object": "chat.completion", "created": 1789740812, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"code\":\"def lower_bound(nums, target):\\n lo = 0\\n hi = len(nums)\\n while lo < hi:\\n mid = (lo + hi) // 2\\n if nums[mid] < target:\\n lo = mid + 1\\n else:\\n hi = mid\\n return lo\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants a Python function `lower_bound` that returns the index of the first element >= target in a sorted list `nums`, or `len(nums)` if none exists.\n\nConstraints:\n- Return ONLY a JSON object with a code string\n- No imports, type annotations, decorators, top-level statements, or helper functions\n- Allowed builtins: sorted, len, range, min, max, list, enumerate, sum\n- Allowed methods: append, sort, copy\n\nLet me write a binary search implementation for lower_bound:\n\n```python\ndef lower_bound(nums, target):\n lo = 0\n hi = len(nums)\n while lo < hi:\n mid = (lo + hi) // 2\n if nums[mid] < target:\n lo = mid + 1\n else:\n hi = mid\n return lo\n```\n\nThis is a standard binary search for lower bound. Let me check constraints:\n- No imports ✓\n- No type annotations ✓\n- No decorators ✓\n- No top-level statements (just the function definition) ✓\n- No helper functions ✓\n- Uses `len` which is allowed ✓\n- No other builtins needed ✓\n\nNow I need to wrap this in a JSON object with a \"code\" string field.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 92, "total_tokens": 442, "completion_tokens": 350, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 274}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "tool-arguments", "passed": true, "response": {"id": "chatcmpl-b686b7cb17c289f3", "object": "chat.completion", "created": 1789740817, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": null, "refusal": null, "annotations": null, "audio": null, "function_call": null, "tool_calls": [{"id": "chatcmpl-tool-8b3933eec1e344ce", "type": "function", "function": {"name": "create_ticket", "arguments": "{\"title\": \"GPU cooling failure\", \"priority\": \"urgent\", \"asset\": \"GPU-092\"}"}}], "reasoning": "The user wants me to create a ticket with specific parameters:\n- title: \"GPU cooling failure\" (exactly)\n- priority: \"urgent\"\n- asset: \"GPU-092\" (exactly)\n\nThis is straightforward - I'll call the create_ticket function with these exact values.\n"}, "logprobs": null, "finish_reason": "tool_calls", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 325, "total_tokens": 447, "completion_tokens": 122, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 65}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
@@ -0,0 +1,7 @@
|
|||||||
|
{"name": "invoice-extraction", "passed": true, "elapsed_s": 1.853186526999707, "response": {"id": "chatcmpl-9004d24804c21cdc", "object": "chat.completion", "created": 1789702200, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\n \"supplier\": \"North Star Ltd\",\n \"currency\": \"CNY\",\n \"total\": 476,\n \"due_date\": \"2026-10-03\"\n}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "We need answer user's request. Need produce final only JSON. Need compute total: 3*125=375, 2*48=96, shipping 20, discount 15. total = 375+96+20-15=476. Keys supplier, currency, total, due_date. JSON only. Ensure integer total.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 132, "total_tokens": 270, "completion_tokens": 138, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 85}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "deduplicate", "passed": true, "elapsed_s": 3.305690247001621, "response": {"id": "chatcmpl-8c78159521c60876", "object": "chat.completion", "created": 1789702202, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "We need answer user's request. Need parse input orders: \"A pending 12; B paid 20; A paid 15; C cancelled 99; D paid 8; B paid 25. Keep the last occurrence of each ID, discard cancelled orders, and output ONLY JSON {\"ids\":[...],\"total\":...}. Sort IDs alphabetically.\"\n\nNeed produce final only JSON. Let's compute.\nOrders in sequence:\nA pending 12\nB paid 20\nA paid 15\nC cancelled 99\nD paid 8\nB paid 25\nKeep last occurrence of each ID: A last paid 15, B last paid 25, C last cancelled 99, D paid 8. Discard cancelled orders: remove C. Remaining A 15, B 25, D 8. Sort IDs alphabetically: A, B, D. Total = 15+25+8=48. Output {\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}. Ensure ONLY JSON no markdown.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 120, "total_tokens": 370, "completion_tokens": 250, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 233}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "schedule", "passed": true, "elapsed_s": 3.0858910660008405, "response": {"id": "chatcmpl-b6ceeff440eaa531", "object": "chat.completion", "created": 1789702205, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\n \"earliest_finish\": 10,\n \"critical_path\": [\"A\", \"B\", \"D\"]\n}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "We need answer user's request. Need parse problem. \"Jobs A takes 3 hours; B takes 5 hours after A; C takes 4 hours after A; D takes 2 hours after both B and C. Unlimited workers, start at hour 0. Output only JSON with earliest_finish and critical_path (array of job letters).\"\n\nWe need compute earliest finish times. A duration 3, starts 0 finishes 3. B after A duration 5 => starts 3 finishes 8. C after A duration 4 => starts 3 finishes 7. D after both B and C duration 2 => starts max(8,7)=8 finishes 10. Earliest finish overall 10. Critical path longest path: A->B->D (3+5+2=10). Output only JSON. Need ensure valid JSON. {\"earliest_finish\":10,\"critical_path\":[\"A\",\"B\",\"D\"]}. No extra text.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 110, "total_tokens": 343, "completion_tokens": 233, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 201}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "chinese-policy", "passed": true, "elapsed_s": 3.033975599999394, "response": {"id": "chatcmpl-9c030a36836653bb", "object": "chat.completion", "created": 1789702208, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\n \"甲\": \"主管\",\n \"乙\": \"经理\",\n \"丙\": \"经理\",\n \"丁\": \"总监\"\n}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "We need answer user's request. Need produce final only JSON. Need parse Chinese:\nRule: amount <=5000 supervisor (主管); >5000 and <=20000 manager (经理); >20000 director (总监). Urgent doesn't change approver.\nApplications: 甲 5000 -> <=5000 => 主管. 乙 5001 加急 -> >5000 <=20000 => 经理. 丙 20000 -> <=20000 and >5000 => 经理. 丁 20001 -> >20000 => 总监.\nOutput only JSON keys 甲乙丙丁 values. Ensure valid JSON. Could be {\"甲\":\"主管\",\"乙\":\"经理\",\"丙\":\"经理\",\"丁\":\"总监\"}.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 148, "total_tokens": 377, "completion_tokens": 229, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 191}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "merge-intervals", "passed": false, "error": "the JSON object must be str, bytes or bytearray, not NoneType"}
|
||||||
|
{"name": "binary-search", "passed": true, "validation_stdout": "passed\n", "validation_stderr": "", "response": {"id": "chatcmpl-89efbe814cd5878e", "object": "chat.completion", "created": 1789702318, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"code\":\"def lower_bound(nums, target):\\n lo = 0\\n hi = len(nums)\\n while lo < hi:\\n mid = (lo + hi) // 2\\n if nums[mid] < target:\\n lo = mid + 1\\n else:\\n hi = mid\\n return lo\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "We need answer user's request. Need produce final ONLY JSON object with a code string. Need satisfy constraints: Write Python function lower_bound. Return index first element >= target in sorted list nums, or len(nums) if none. Parameters nums, target. Reply ONLY JSON object with a code string. Use no imports, type annotations, decorators, top-level statements or helper functions. Allowed builtins: sorted,len,range,min,max,list,enumerate,sum. Allowed methods: append,sort,copy.\n\nNeed output JSON object likely {\"code\": \"def lower_bound(nums, target):\\n ...\"}. No imports etc. Function only. Need maybe binary search using len, range? No type annotations. Could implement:\ndef lower_bound(nums, target):\n lo = 0\n hi = len(nums)\n while lo < hi:\n mid = (lo + hi) // 2\n if nums[mid] < target:\n lo = mid + 1\n else:\n hi = mid\n return lo\n\nThis uses no disallowed builtins. JSON string must escape newlines. Ensure only JSON object. Could include code string. Need no top-level statements. Good.\n\nDouble-check allowed builtins: len allowed. // operator okay. No helper. No annotations.\n\nNeed final only JSON. Ensure valid JSON. Could be:\n{\"code\":\"def lower_bound(nums, target):\\n lo = 0\\n hi = len(nums)\\n while lo < hi:\\n mid = (lo + hi) // 2\\n if nums[mid] < target:\\n lo = mid + 1\\n else:\\n hi = mid\\n return lo\"}\n\nNo trailing newline? fine.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 134, "total_tokens": 572, "completion_tokens": 438, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 362}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "tool-arguments", "passed": true, "response": {"id": "chatcmpl-817dda016167c20b", "object": "chat.completion", "created": 1789702324, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": null, "refusal": null, "annotations": null, "audio": null, "function_call": null, "tool_calls": [{"id": "chatcmpl-tool-8dbfec4209335069", "type": "function", "function": {"name": "create_ticket", "arguments": "{\"title\": \"GPU cooling failure\", \"priority\": \"urgent\", \"asset\": \"GPU-092\"}"}}], "reasoning": "We need to respond to user: \"Call create_ticket with title exactly GPU cooling failure, priority urgent, and asset exactly GPU-092.\" Need call tool. Need final maybe brief. Ensure exact params.\n"}, "logprobs": null, "finish_reason": "tool_calls", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9c4a3436", "usage": {"prompt_tokens": 363, "total_tokens": 464, "completion_tokens": 101, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 44}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
@@ -0,0 +1,540 @@
|
|||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347]
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347] █ █ █▄ ▄█
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347] ▄▄ ▄█ █ █ █ ▀▄▀ █ version 0.3.1.dev3+g0bfc7a15d
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347] █▄█▀ █ █ █ █ model /model
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347] ▀▀ ▀▀▀▀▀ ▀▀▀▀▀ ▀ ▀
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:347]
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [api_utils.py:286] non-default args: {'model_tag': '/model', 'enable_auto_tool_choice': True, 'tool_call_parser': 'qwen3_xml', 'host': '0.0.0.0', 'api_key': '***', 'model': '/model', 'dtype': 'bfloat16', 'max_model_len': 131072, 'served_model_name': ['qwen3.8-flash-next'], 'load_format': 'safetensors', 'reasoning_parser': 'qwen3', 'gpu_memory_utilization': 0.96, 'kv_cache_dtype': 'fp8', 'enable_prefix_caching': True, 'max_num_batched_tokens': 2048, 'max_num_seqs': 1, 'enable_chunked_prefill': True, 'enable_flashinfer_autotune': False, 'compilation_config': {'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': [], 'ir_enable_torch_wrap': None, 'splitting_ops': None, 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': None, 'compile_ranges_endpoints': None, 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL: 2>, 'cudagraph_num_of_warmups': 0, 'cudagraph_capture_sizes': [1], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': None, 'pass_config': {}, 'max_cudagraph_capture_size': None, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': None, 'static_all_moe_layers': []}, 'engram_config': EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [model.py:691] Resolved architecture: Qwen4ExpForConditionalGeneration
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:48 [model.py:2024] Using max model len 131072
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [cache.py:345] Using fp8 data type to store kv cache. It reduces the GPU memory footprint and boosts the performance. Meanwhile, it may cause accuracy drop without a proper scaling factor
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [config.py:625] Mamba cache mode is set to 'align' for Qwen4ExpForConditionalGeneration by default when prefix caching is enabled
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [vllm.py:1271] Resolved Engram configuration: EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [vllm.py:781] Auto-enabling VLLM_USE_BREAKABLE_CUDAGRAPH=1. Set VLLM_USE_BREAKABLE_CUDAGRAPH=0 to opt out.
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [kernel.py:408] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native'])
|
||||||
|
(APIServer pid=1) INFO 09-18 02:59:52 [compilation.py:331] Enabled custom fusions: norm_quant, act_quant
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:04 [core.py:123] Initializing a V1 LLM engine (v0.3.1.dev3+g0bfc7a15d) with config: model='/model', speculative_config=None, tokenizer='/model', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=False, dtype=torch.bfloat16, max_seq_len=131072, download_dir=None, load_format=safetensors, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=modelopt_mixed, quantization_config=None, enforce_eager=False, enable_return_routed_experts=False, kv_cache_dtype=fp8, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='qwen3', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, per_request_spec_decode_metrics='none', kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False, jit_monitor_mode='warn', jit_monitor_verbose=False), seed=0, served_model_name=qwen3.8-flash-next, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['+quant_fp8', 'all', '+quant_fp8'], 'ir_enable_torch_wrap': False, 'splitting_ops': [], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': [], 'compile_ranges_endpoints': [2048], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL: 2>, 'cudagraph_num_of_warmups': 1, 'cudagraph_capture_sizes': [1], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': True, 'fuse_act_quant': True, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False, 'enable_qk_norm_rope_fusion': False, 'fuse_rope_kvcache_cat_mla': False, 'fuse_act_padding': False, 'fuse_qk_norm_rope_kvcache': False}, 'max_cudagraph_capture_size': 1, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native']), enable_flashinfer_autotune=False, enable_cutedsl_warmup=True, enable_jit_warmup=True, moe_backend='auto', sparse_indexer_topk_backend='auto', linear_backend='auto', linear_backend_per_quant=None)
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:05 [parallel_state.py:1825] world_size=1 rank=0 local_rank=0 distributed_init_method=file:///tmp/vllm_dist_1ab23a515b4248119daf657c8672946f backend=nccl
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:05 [parallel_state.py:2269] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, ETP rank 0, EP rank 0, EPLB rank N/A
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:05 [gpu_worker.py:441] Using V2 Model Runner
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:06 [model_runner.py:387] Loading model from scratch...
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:06 [cuda.py:595] Using backend AttentionBackendEnum.FLASH_ATTN for vit attention
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:06 [mm_encoder_attention.py:372] Using AttentionBackendEnum.FLASH_ATTN for MMEncoderAttention.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:06 [qwen_gdn_linear_attn.py:176] Using FlashInfer GDN prefill kernel (requested=auto, head_k_dim=128).
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:06 [qwen_gdn_linear_attn.py:528] GDN decode kernel: cuda
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:08 [nvfp4.py:302] Using 'FLASHINFER_CUTLASS' NvFp4 MoE backend out of potential backends: ['FLASHINFER_TRTLLM', 'FLASHINFER_CUTEDSL', 'FLASHINFER_CUTEDSL_BATCHED', 'FLASHINFER_CUTLASS', 'VLLM_CUTLASS', 'MARLIN', 'HUMMING', 'EMULATION'].
|
||||||
|
(APIServer pid=1) [transformers] Qwen3VL video processing does not apply the per-frame pixel cap the reference implementation (qwen-vl-utils) applies, so some videos cost far more tokens than they would there. In v5.22 the capped behavior will become the default and `cap_pixels_per_frame` will be removed. Pass `cap_pixels_per_frame=True` to adopt the reference behavior now, or `False` to keep the current behavior and silence this warning.
|
||||||
|
(APIServer pid=1) INFO 09-18 03:00:10 [base.py:261] Multi-modal warmup completed in 12.284s
|
||||||
|
(APIServer pid=1) INFO 09-18 03:00:12 [base.py:261] Readonly multi-modal warmup completed in 1.318s
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:42 [ngram_embedding.py:720] Initialized PLE embedding language_model.model.layers.1.ple.ple_embedding.ngram_embedding: quantization_method=Qwen4ExpPLEFp8EmbeddingMethod, weight_dtype=torch.float8_e4m3fn, weight_device=cpu, pinned=True
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:42 [flash_attn.py:1115] Using FlashAttention version 2
|
||||||
|
(EngineCore pid=113) WARNING 09-18 03:00:42 [compilation.py:1350] Op 'quant_fp8' not present in model, enabling with '+quant_fp8' has no effect
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:42 [weight_utils.py:900] Filesystem type for checkpoints: EXT4. Checkpoint size: 123.57 GiB. Available RAM: 142.30 GiB.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:00:42 [weight_utils.py:923] Auto-prefetch is disabled because the filesystem (EXT4) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 0% Completed | 0/11 [00:00<?, ?it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 9% Completed | 1/11 [00:01<00:16, 1.63s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 18% Completed | 2/11 [00:06<00:33, 3.75s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 27% Completed | 3/11 [00:12<00:36, 4.54s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 36% Completed | 4/11 [00:17<00:34, 4.91s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 45% Completed | 5/11 [00:23<00:30, 5.15s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 55% Completed | 6/11 [00:29<00:26, 5.35s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 64% Completed | 7/11 [00:34<00:21, 5.40s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 73% Completed | 8/11 [00:40<00:16, 5.48s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 82% Completed | 9/11 [00:41<00:08, 4.21s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:42<00:00, 2.40s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:42<00:00, 3.86s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:25 [default_loader.py:430] Loading weights took 42.62 seconds
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:25 [nvfp4.py:611] Using MoEPrepareAndFinalizeNoDPEPModular
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:26 [model_runner.py:419] Model loading took 73.77 GiB memory and 80.192933 seconds
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:26 [topk_topp_sampler.py:78] Using FlashInfer for top-p & top-k sampling.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:26 [interface.py:918] Setting attention block size to 3136 tokens to ensure that attention page size is >= mamba page size.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:26 [interface.py:942] Padding mamba page size by 0.13% to ensure that mamba page size and attention page size are exactly equal.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:26 [utils.py:320] Using BLNHC KV cache layout.
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:30 [encoder_runner.py:131] Encoder cache will be initialized with a budget of 16384 tokens, and profiled with 1 image items of the maximum feature size.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 03:01:52 [compilation.py:1415] CUDAGraphMode.FULL is not supported with GDNAttentionBackend backend (support: AttentionCGSupport.UNIFORM_BATCH); setting cudagraph_mode=FULL_DECODE_ONLY
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:02<00:00, 2.12s/it]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:02<00:00, 2.12s/it]
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [model_runner.py:1057] Graph capturing finished in 3 secs, took 0.09 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [gpu_worker.py:641] Available KV cache memory: 3.27 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [gpu_worker.py:656] CUDA graph memory profiling is enabled (default since v0.21.0). The current --gpu-memory-utilization=0.9600 is equivalent to --gpu-memory-utilization=0.9590 without CUDA graph memory profiling. To maintain the same effective KV cache size as before, increase --gpu-memory-utilization to 0.9610. To disable, set VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [kv_cache_utils.py:2404] GPU KV cache size: 218,453 tokens, Maximum concurrency for 131,072 tokens per request: 1.67x
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [kernel_warmup.py:171] JIT kernel warmup starting.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [kernel_warmup.py:184] JIT kernel warmup finished in 0.00s.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:55 [qwen_vl_triton_warmup.py:57] Warmed position embedding and vision rotary kernels on grids=[(1, 16, 16), (1, 16, 2), (1, 2, 16), (1, 2, 2)].
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:56 [qwen_vl_triton_warmup.py:98] Warmed M-RoPE Triton kernels.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:56 [mamba_triton_warmup.py:42] Warmed Mamba batch_memcpy_kernel.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:01:56 [qwen4_exp_qsa_warmup.py:71] Warmed up Qwen4Exp QSA decode kernels: ((1, 1),).
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:01 [qwen4_exp_qsa_warmup.py:85] Warmed up Qwen4Exp QSA sparse attention kernels: ((32, 2, 1), (32, 4, 4), (64, 1, 2), (64, 4, 4), (64, 8, 4), (64, 33, 8), (128, 4, 4), (128, 8, 4)).
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:01 [kernel_warmup.py:254] Skipping FlashInfer autotune because it is disabled.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 9.77it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 9.76it/s]
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:06 [model_runner.py:1057] Graph capturing finished in 1 secs, took 0.05 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:06 [gpu_worker.py:824] CUDA graph pool memory: 0.05 GiB (actual), 0.09 GiB (estimated), difference: 0.04 GiB (76.0%).
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:06 [gpu_worker.py:887] Free memory on device (82.59/83.05 GiB) on startup. Desired GPU memory utilization is (0.96, 79.73 GiB). Actual usage is 74.5 GiB for consumed memory (weights + non-torch), 1.95 GiB for peak activation, and 0.05 GiB for CUDAGraph memory. Replace gpu_memory_utilization config with `--kv-cache-memory=3303888446` (3.08 GiB) to fit into requested memory, or `--kv-cache-memory=6379883520` (5.94 GiB) to fully utilize gpu memory. Current kv cache memory in use is 3.27 GiB.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:07 [jit_monitor.py:84] Kernel JIT monitor activated; monitored JIT compilations during inference will use mode=warn.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 03:02:08 [torch_utils.py:274] OMP_NUM_THREADS=8 is set; leaving Torch threads at 8 for serving. Multi-threaded torch CPU ops during serving can degrade performance through spin-wait contention and cgroup CPU-quota throttling.
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [core.py:380] init engine (profile, create kv cache, warmup model) took 41.59 s
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [kv_cache_utils.py:762] kv cache group sizes [3136, 3136, 3136, 3136, 4, 3136]
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [kv_cache_utils.py:763] kv lcm block sizes 3136
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [vllm.py:1271] Resolved Engram configuration: EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [kernel.py:408] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native'])
|
||||||
|
(EngineCore pid=113) INFO 09-18 03:02:08 [compilation.py:331] Enabled custom fusions: norm_quant, act_quant
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [entry.py:132] Supported tasks: ['generate']
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [factories.py:76] Scale-out endpoints are disabled. Set --enable-scale-out to enable them.
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [parser_manager.py:34] "auto" tool choice has been enabled.
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [hf.py:642] Detected the chat template content format to be 'openai'. You can set `--chat-template-content-format` to override this.
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:02:08 [model.py:1769] Default vLLM sampling parameters have been overridden by the model's `generation_config.json`: `{'temperature': 1.0, 'top_k': 20, 'top_p': 0.95}`. If this is not intended, please relaunch vLLM instance with `--generation-config vllm`.
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [entry.py:136] Starting vLLM server on http://0.0.0.0:8000
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:60] Available routes are:
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /openapi.json, Methods: GET, HEAD
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /docs, Methods: GET, HEAD
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /docs/oauth2-redirect, Methods: GET, HEAD
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /redoc, Methods: GET, HEAD
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /load, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /version, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /health, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /metrics, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /tokenize, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /detokenize, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/models, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /ping, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /ping, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /invocations, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/chat/completions, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/chat/completions/batch, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/responses, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/responses/{response_id}, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/responses/{response_id}/cancel, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/completions, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/messages, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /v1/messages/count_tokens, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /generative_scoring, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /scale_elastic_ep, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:08 [launcher.py:69] Route: /is_scaling_elastic_ep, Methods: POST
|
||||||
|
(APIServer pid=1) INFO: Started server process [1]
|
||||||
|
(APIServer pid=1) INFO: Waiting for application startup.
|
||||||
|
(APIServer pid=1) INFO: Application startup complete.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33126 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33128 - "GET /v1/models HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33134 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(EngineCore pid=113) WARNING 09-18 03:02:09 [jit_monitor.py:140] Triton kernel JIT compilation during inference: layer_norm_fwd_kernel. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33136 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33152 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:45876 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:19 [loggers.py:323] Engine 000: Avg prompt throughput: 36.8 tokens/s, Avg generation throughput: 13.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 0.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:02:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 0.0%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:48246 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:45366 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47264 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:40622 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49122 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:46812 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:43410 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49034 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:57140 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:39204 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:36896 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:40524 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:42630 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47942 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:35640 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44096 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44108 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44120 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44134 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44140 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44146 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38816 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38820 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38832 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38848 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38862 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:09:59 [loggers.py:323] Engine 000: Avg prompt throughput: 59.0 tokens/s, Avg generation throughput: 67.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 0.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38878 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38882 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38896 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38900 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46990 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:10:09 [loggers.py:323] Engine 000: Avg prompt throughput: 1547.3 tokens/s, Avg generation throughput: 49.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 0.0%, MM cache hit rate: 0.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46992 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47000 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47012 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47018 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47032 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47044 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47058 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47074 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47084 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47094 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47108 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47116 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47124 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:12 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47140 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) [transformers] Token indices sequence length is longer than the specified maximum sequence length for this model (268298 > 262144). Running this sequence through the model will result in indexing errors
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47142 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47154 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47168 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47176 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47184 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47196 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47206 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47214 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47226 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:59622 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47232 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47244 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47252 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47266 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47276 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44820 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:10:19 [loggers.py:323] Engine 000: Avg prompt throughput: 1235.6 tokens/s, Avg generation throughput: 14.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 28.6%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:10:29 [loggers.py:323] Engine 000: Avg prompt throughput: 12598.2 tokens/s, Avg generation throughput: 9.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 54.8%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54018 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54020 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54032 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:10:39 [loggers.py:323] Engine 000: Avg prompt throughput: 111.0 tokens/s, Avg generation throughput: 27.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 31.0%, Prefix cache hit rate: 48.4%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:57240 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) WARNING 09-18 03:10:45 [hf.py:879] Chat template rejected the request: Unexpected reasoning effort high. Supported types are xhigh (default), medium, and low.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38526 - "POST /v1/chat/completions HTTP/1.1" 400 Bad Request
|
||||||
|
(APIServer pid=1) INFO 09-18 03:10:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 48.4%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35840 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:09 [loggers.py:323] Engine 000: Avg prompt throughput: 5.9 tokens/s, Avg generation throughput: 3.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 48.4%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35848 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35864 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35872 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35888 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35896 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35910 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:53726 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45488 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45496 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45510 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45520 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:19 [loggers.py:323] Engine 000: Avg prompt throughput: 59.1 tokens/s, Avg generation throughput: 71.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 48.3%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45536 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45552 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45566 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45576 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52076 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52080 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:29 [loggers.py:323] Engine 000: Avg prompt throughput: 2776.9 tokens/s, Avg generation throughput: 50.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52090 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52094 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:39 [loggers.py:323] Engine 000: Avg prompt throughput: 15.4 tokens/s, Avg generation throughput: 76.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49718 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:11:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35380 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:09 [loggers.py:323] Engine 000: Avg prompt throughput: 7.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41060 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.9%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35078 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:29 [loggers.py:323] Engine 000: Avg prompt throughput: 7.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:38006 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60488 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43418 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:12:59 [loggers.py:323] Engine 000: Avg prompt throughput: 15.8 tokens/s, Avg generation throughput: 76.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:38036 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43076 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:29 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:59088 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43398 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:13:59 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:37614 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:50104 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:19 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:50108 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:29 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49780 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36156 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:49 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:14:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33486 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41522 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:19 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46554 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:54702 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:49 [loggers.py:323] Engine 000: Avg prompt throughput: 7.5 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:15:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:55592 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41374 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:16:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:38054 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:46862 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:17:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:43844 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.9%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.9%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:34270 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.9%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:18:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.9%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.1%, Prefix cache hit rate: 45.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) [transformers] Token indices sequence length is longer than the specified maximum sequence length for this model (268298 > 262144). Running this sequence through the model will result in indexing errors
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36216 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36232 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36246 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36254 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36270 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53790 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53794 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53802 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53814 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53826 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53834 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53838 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53846 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53852 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53866 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:55542 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53876 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:19 [loggers.py:323] Engine 000: Avg prompt throughput: 1937.1 tokens/s, Avg generation throughput: 46.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 53.0%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53888 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53900 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59136 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59146 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59154 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59170 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:29 [loggers.py:323] Engine 000: Avg prompt throughput: 637.6 tokens/s, Avg generation throughput: 67.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 68.9%, MM cache hit rate: 85.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59186 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59190 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59206 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44972 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:39 [loggers.py:323] Engine 000: Avg prompt throughput: 643.5 tokens/s, Avg generation throughput: 68.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 72.1%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:58578 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 72.1%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:19:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 72.1%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:57826 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:09 [loggers.py:323] Engine 000: Avg prompt throughput: 8.6 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 72.1%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:43346 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 72.1%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51208 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51212 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:29 [loggers.py:323] Engine 000: Avg prompt throughput: 55.5 tokens/s, Avg generation throughput: 74.6 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 74.7%, MM cache hit rate: 87.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51220 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51222 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:39 [loggers.py:323] Engine 000: Avg prompt throughput: 588.2 tokens/s, Avg generation throughput: 71.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 74.6%, MM cache hit rate: 88.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:42298 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 74.6%, MM cache hit rate: 88.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:20:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 74.6%, MM cache hit rate: 88.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:42934 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:09 [loggers.py:323] Engine 000: Avg prompt throughput: 8.4 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 74.6%, MM cache hit rate: 88.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:58604 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 74.6%, MM cache hit rate: 88.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:57912 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:57914 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:29 [loggers.py:323] Engine 000: Avg prompt throughput: 369.0 tokens/s, Avg generation throughput: 72.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 76.6%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:57928 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:57934 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:39 [loggers.py:323] Engine 000: Avg prompt throughput: 274.8 tokens/s, Avg generation throughput: 73.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 76.6%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:60802 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 76.6%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46352 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:21:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 76.6%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 76.6%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:36974 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 76.6%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53112 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53114 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:29 [loggers.py:323] Engine 000: Avg prompt throughput: 369.0 tokens/s, Avg generation throughput: 72.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 78.3%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53116 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53120 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:39 [loggers.py:323] Engine 000: Avg prompt throughput: 274.6 tokens/s, Avg generation throughput: 73.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 78.2%, MM cache hit rate: 90.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:54350 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 78.2%, MM cache hit rate: 90.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60880 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:22:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 78.2%, MM cache hit rate: 90.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 78.2%, MM cache hit rate: 90.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:51446 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 78.2%, MM cache hit rate: 90.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47600 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47602 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47618 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:29 [loggers.py:323] Engine 000: Avg prompt throughput: 635.1 tokens/s, Avg generation throughput: 69.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47626 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:39 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:50808 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33200 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:23:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:53902 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 79.6%, MM cache hit rate: 91.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:35818 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60464 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60480 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:29 [loggers.py:323] Engine 000: Avg prompt throughput: 635.1 tokens/s, Avg generation throughput: 69.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60486 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:39 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:36330 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47132 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:24:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:60010 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 80.8%, MM cache hit rate: 92.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37630 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60520 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60522 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:29 [loggers.py:323] Engine 000: Avg prompt throughput: 635.1 tokens/s, Avg generation throughput: 69.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60526 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:39 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:43716 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52900 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:25:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41628 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 81.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52472 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60460 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60464 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60476 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:29 [loggers.py:323] Engine 000: Avg prompt throughput: 643.8 tokens/s, Avg generation throughput: 68.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:55028 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:34742 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:26:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49266 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 82.7%, MM cache hit rate: 93.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44380 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44394 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:55470 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:55480 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:29 [loggers.py:323] Engine 000: Avg prompt throughput: 643.8 tokens/s, Avg generation throughput: 68.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47762 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:32878 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:27:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:54118 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 83.5%, MM cache hit rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37126 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37132 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38250 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38262 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:29 [loggers.py:323] Engine 000: Avg prompt throughput: 643.6 tokens/s, Avg generation throughput: 68.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47208 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37546 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:28:59 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:40912 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.2%, MM cache hit rate: 94.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38312 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38320 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33350 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33362 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:29 [loggers.py:323] Engine 000: Avg prompt throughput: 643.8 tokens/s, Avg generation throughput: 68.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:53680 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:29:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 28.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46494 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:46498 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54326 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:09 [loggers.py:323] Engine 000: Avg prompt throughput: 51.0 tokens/s, Avg generation throughput: 62.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54342 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:54520 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:19 [loggers.py:323] Engine 000: Avg prompt throughput: 12.3 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 77.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41504 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:30:59 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:09 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:45670 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:19 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:29 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.3%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:39 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:37016 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:49 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.5%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54348 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 03:31:59 [loggers.py:323] Engine 000: Avg prompt throughput: 13.4 tokens/s, Avg generation throughput: 76.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.1%, Prefix cache hit rate: 84.8%, MM cache hit rate: 94.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33524 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33196 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
File diff suppressed because one or more lines are too long
@@ -0,0 +1,45 @@
|
|||||||
|
name: qwen38-flash-rtx6000d
|
||||||
|
services:
|
||||||
|
vllm:
|
||||||
|
image: local/qwen38-flash-6000d:0bfc7a15
|
||||||
|
build: .
|
||||||
|
container_name: qwen38-flash-6000d
|
||||||
|
gpus: all
|
||||||
|
shm_size: 8g
|
||||||
|
mem_limit: 210g
|
||||||
|
memswap_limit: 210g
|
||||||
|
restart: unless-stopped
|
||||||
|
ports:
|
||||||
|
- "${BIND_ADDRESS:-127.0.0.1}:${API_PORT:-8000}:8000"
|
||||||
|
environment:
|
||||||
|
HF_HUB_OFFLINE: "1"
|
||||||
|
VLLM_USE_V2_MODEL_RUNNER: "1"
|
||||||
|
VLLM_WORKER_MULTIPROC_METHOD: spawn
|
||||||
|
OMP_NUM_THREADS: "8"
|
||||||
|
TORCHINDUCTOR_COMPILE_THREADS: "2"
|
||||||
|
CUTE_DSL_ARCH: sm_120a
|
||||||
|
volumes:
|
||||||
|
- /data/flash-next/models/nvidia-Qwen3.8-Flash-Next-NVFP4:/model:ro
|
||||||
|
- /data/flash-next/cache:/root/.cache
|
||||||
|
- ./secrets/api-key:/run/secrets/api-key:ro
|
||||||
|
entrypoint: ["/bin/bash", "-lc"]
|
||||||
|
command:
|
||||||
|
- >-
|
||||||
|
exec vllm serve /model
|
||||||
|
--served-model-name qwen3.8-flash-next
|
||||||
|
--host 0.0.0.0 --port 8000
|
||||||
|
--tensor-parallel-size 1 --dtype bfloat16
|
||||||
|
--engram-config '{"cpu_offload":true}'
|
||||||
|
--kv-cache-dtype fp8 --gpu-memory-utilization 0.96
|
||||||
|
--max-model-len 131072 --max-num-seqs 1 --max-num-batched-tokens 2048
|
||||||
|
--enable-chunked-prefill --enable-prefix-caching
|
||||||
|
--compilation-config '{"mode":0,"cudagraph_mode":"FULL","cudagraph_capture_sizes":[1]}' --no-enable-flashinfer-autotune
|
||||||
|
--load-format safetensors
|
||||||
|
--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
|
||||||
|
--api-key "$$(cat /run/secrets/api-key)"
|
||||||
|
healthcheck:
|
||||||
|
test: ["CMD", "python3", "-c", "import urllib.request; urllib.request.urlopen('http://127.0.0.1:8000/health', timeout=5)"]
|
||||||
|
interval: 30s
|
||||||
|
timeout: 10s
|
||||||
|
retries: 5
|
||||||
|
start_period: 30m
|
||||||
@@ -0,0 +1,8 @@
|
|||||||
|
{
|
||||||
|
"time": 1789742112.2115133,
|
||||||
|
"health": "healthy",
|
||||||
|
"oom_killed": false,
|
||||||
|
"restart_policy": "unless-stopped",
|
||||||
|
"mtp_active": true,
|
||||||
|
"config": "MTP 2, 128K, FP8 KV, GPU budget 0.985"
|
||||||
|
}
|
||||||
@@ -0,0 +1,26 @@
|
|||||||
|
# HELP vllm:spec_decode_num_drafts_total Number of spec decoding drafts.
|
||||||
|
# TYPE vllm:spec_decode_num_drafts_total counter
|
||||||
|
vllm:spec_decode_num_drafts_total{engine="0",model_name="qwen3.8-flash-next"} 42344.0
|
||||||
|
# HELP vllm:spec_decode_num_drafts_created Number of spec decoding drafts.
|
||||||
|
# TYPE vllm:spec_decode_num_drafts_created gauge
|
||||||
|
vllm:spec_decode_num_drafts_created{engine="0",model_name="qwen3.8-flash-next"} 1.7897410011528008e+09
|
||||||
|
# HELP vllm:spec_decode_num_draft_tokens_total Number of draft tokens.
|
||||||
|
# TYPE vllm:spec_decode_num_draft_tokens_total counter
|
||||||
|
vllm:spec_decode_num_draft_tokens_total{engine="0",model_name="qwen3.8-flash-next"} 84688.0
|
||||||
|
# HELP vllm:spec_decode_num_draft_tokens_created Number of draft tokens.
|
||||||
|
# TYPE vllm:spec_decode_num_draft_tokens_created gauge
|
||||||
|
vllm:spec_decode_num_draft_tokens_created{engine="0",model_name="qwen3.8-flash-next"} 1.7897410011528184e+09
|
||||||
|
# HELP vllm:spec_decode_num_accepted_tokens_total Number of accepted tokens.
|
||||||
|
# TYPE vllm:spec_decode_num_accepted_tokens_total counter
|
||||||
|
vllm:spec_decode_num_accepted_tokens_total{engine="0",model_name="qwen3.8-flash-next"} 56280.0
|
||||||
|
# HELP vllm:spec_decode_num_accepted_tokens_created Number of accepted tokens.
|
||||||
|
# TYPE vllm:spec_decode_num_accepted_tokens_created gauge
|
||||||
|
vllm:spec_decode_num_accepted_tokens_created{engine="0",model_name="qwen3.8-flash-next"} 1.7897410011528296e+09
|
||||||
|
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_total Accepted tokens per draft position.
|
||||||
|
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_total counter
|
||||||
|
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="qwen3.8-flash-next",position="0"} 32436.0
|
||||||
|
vllm:spec_decode_num_accepted_tokens_per_pos_total{engine="0",model_name="qwen3.8-flash-next",position="1"} 23844.0
|
||||||
|
# HELP vllm:spec_decode_num_accepted_tokens_per_pos_created Accepted tokens per draft position.
|
||||||
|
# TYPE vllm:spec_decode_num_accepted_tokens_per_pos_created gauge
|
||||||
|
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="qwen3.8-flash-next",position="0"} 1.7897410011528459e+09
|
||||||
|
vllm:spec_decode_num_accepted_tokens_per_pos_created{engine="0",model_name="qwen3.8-flash-next",position="1"} 1.78974100115285e+09
|
||||||
@@ -0,0 +1,7 @@
|
|||||||
|
{"name": "invoice-extraction", "passed": true, "elapsed_s": 1.270394352999574, "response": {"id": "chatcmpl-929e3376567b7cab", "object": "chat.completion", "created": 1789741977, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"supplier\":\"North Star Ltd\",\"currency\":\"CNY\",\"total\":476,\"due_date\":\"2026-10-03\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants me to extract invoice data into JSON format. Let me parse the information:\n\n- Supplier: North Star Ltd\n- Currency: CNY\n- Rows: 3 items at 125 each = 375, 2 items at 48 each = 96\n- Shipping: 20\n- Discount: 15\n- Total: 375 + 96 + 20 - 15 = 476\n- Due date: 2026-10-03\n\nThe total must be an integer: 476\n\nKeys required: supplier, currency, total, due_date\n\nLet me format as JSON only.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 90, "total_tokens": 275, "completion_tokens": 185, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 150}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "deduplicate", "passed": true, "elapsed_s": 1.752616023994051, "response": {"id": "chatcmpl-be8642374cd91a1f", "object": "chat.completion", "created": 1789741978, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "Let me process the orders step by step.\n\nInput orders:\n1. A pending 12\n2. B paid 20\n3. A paid 15\n4. C cancelled 99\n5. D paid 8\n6. B paid 25\n\nStep 1: Keep the last occurrence of each ID.\n- A: last occurrence is \"A paid 15\" (order 3)\n- B: last occurrence is \"B paid 25\" (order 6)\n- C: last occurrence is \"C cancelled 99\" (order 4)\n- D: last occurrence is \"D paid 8\" (order 5)\n\nStep 2: Discard cancelled orders.\n- C is cancelled, so discard it.\n- Remaining: A paid 15, B paid 25, D paid 8\n\nStep 3: Sort IDs alphabetically.\n- A, B, D\n\nStep 4: Calculate total.\n- 15 + 25 + 8 = 48\n\nOutput: {\"ids\":[\"A\",\"B\",\"D\"],\"total\":48}\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 78, "total_tokens": 342, "completion_tokens": 264, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 247}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "schedule", "passed": true, "elapsed_s": 2.0542921800006297, "response": {"id": "chatcmpl-9dc5afa7afa9fb38", "object": "chat.completion", "created": 1789741980, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"earliest_finish\":10,\"critical_path\":[\"A\",\"B\",\"D\"]}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "Let me analyze this scheduling problem carefully.\n\nJobs and their durations:\n- A: 3 hours (starts at hour 0)\n- B: 5 hours, starts after A\n- C: 4 hours, starts after A\n- D: 2 hours, starts after both B and C\n\nLet me trace the timeline:\n\n- A starts at hour 0, finishes at hour 3.\n- B starts after A → starts at hour 3, finishes at hour 3+5 = 8.\n- C starts after A → starts at hour 3, finishes at hour 3+4 = 7.\n- D starts after both B and C → starts at max(8, 7) = 8, finishes at 8+2 = 10.\n\nEarliest finish: 10 hours.\n\nCritical path: The longest path through the dependency graph.\n- Path A → B → D: 3 + 5 + 2 = 10\n- Path A → C → D: 3 + 4 + 2 = 9\n\nThe critical path is A → B → D with total duration 10.\n\nSo critical_path = [\"A\", \"B\", \"D\"]\nearliest_finish = 10\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 68, "total_tokens": 359, "completion_tokens": 291, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 271}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "chinese-policy", "passed": true, "elapsed_s": 1.3322822580012144, "response": {"id": "chatcmpl-b07bc34a010483b7", "object": "chat.completion", "created": 1789741982, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"甲\":\"主管\",\"乙\":\"经理\",\"丙\":\"经理\",\"丁\":\"总监\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "让我仔细分析审批制度:\n\n- 金额不超过5000元:主管审批\n- 超过5000且不超过20000:经理审批\n- 超过20000:总监审批\n- 加急不改变审批人\n\n现在分析各申请:\n\n甲:5000元 → 不超过5000 → 主管\n乙:5001元加急 → 超过5000且不超过20000 → 经理(加急不改变审批人)\n丙:20000元 → 超过5000且不超过20000 → 经理\n丁:20001元 → 超过20000 → 总监\n\n输出JSON格式。\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 106, "total_tokens": 295, "completion_tokens": 189, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 169}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "merge-intervals", "passed": true, "validation_stdout": "passed\n", "validation_stderr": "", "response": {"id": "chatcmpl-b01102cf94d16554", "object": "chat.completion", "created": 1789741983, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"code\": \"def merge_intervals(intervals):\\n if len(intervals) == 0:\\n return []\\n sorted_intervals = sorted(intervals)\\n merged = [sorted_intervals[0].copy()]\\n for i in range(1, len(sorted_intervals)):\\n current = sorted_intervals[i]\\n last = merged[len(merged) - 1]\\n if current[0] <= last[1]:\\n last[1] = max(last[1], current[1])\\n else:\\n merged.append(current.copy())\\n return merged\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants a Python function `merge_intervals` that merges overlapping integer intervals, including touching endpoints. Let me think about the requirements:\n\n1. Merge overlapping intervals, including touching endpoints (e.g., [1,3] and [3,5] should merge to [1,5])\n2. Return sorted merged intervals as lists\n3. Reply ONLY a JSON object with a code string\n4. No imports, type annotations, decorators, top-level statements or helper functions\n5. Allowed builtins: sorted, len, range, min, max, list, enumerate, sum\n6. Allowed methods: append, sort, copy\n\nLet me write the function:\n\n```python\ndef merge_intervals(intervals):\n if len(intervals) == 0:\n return []\n sorted_intervals = sorted(intervals, key=lambda x: x[0])\n merged = [sorted_intervals[0].copy()]\n for i in range(1, len(sorted_intervals)):\n current = sorted_intervals[i]\n last = merged[len(merged) - 1]\n if current[0] <= last[1]:\n last[1] = max(last[1], current[1])\n else:\n merged.append(current.copy())\n return merged\n```\n\nWait, I need to check - can I use lambda? The allowed builtins are: sorted, len, range, min, max, list, enumerate, sum. Lambda isn't explicitly listed but it's a language construct, not a builtin. Let me think... `sorted` with a key function requires a callable. I could use `sorted(intervals)` since lists sort lexicographically by default, which would sort by first element then second element. That works for intervals!\n\nActually, `sorted(intervals)` on a list of lists will sort by the first element, then second element. That's exactly what we need.\n\nLet me also check: can I use `lambda`? It's not a builtin, it's a keyword/expression. The restriction says \"no imports, type annotations, decorators, top-level statements or helper functions.\" Lambda isn't a helper function per se, it's an anonymous function expression. But to be safe, let me just use `sorted(intervals)` without a key since default sorting of lists works correctly for intervals.\n\nAlso, I need to be careful about `.copy()` - it's in the allowed methods list. And `.append()` and `.sort()` are allowed.\n\nLet me also check: `len(merged) - 1` to get the last index - that's fine.\n\nLet me also make sure I'm not using any disallowed things. No type annotations, no decorators, no top-level statements, no helper functions. The function itself is fine.\n\nLet me format as JSON with a \"code\" key.\n\n```json\n{\"code\": \"def merge_intervals(intervals):\\n if len(intervals) == 0:\\n return []\\n sorted_intervals = sorted(intervals)\\n merged = [sorted_intervals[0].copy()]\\n for i in range(1, len(sorted_intervals)):\\n current = sorted_intervals[i]\\n last = merged[len(merged) - 1]\\n if current[0] <= last[1]:\\n last[1] = max(last[1], current[1])\\n else:\\n merged.append(current.copy())\\n return merged\"}\n```\n\nWait, I should double-check: `sorted(intervals)` on a list of lists like `[[1,3],[2,6],[8,10]]` will sort correctly by first element. Yes, Python's default list comparison is lexicographic, so it compares element by element. This is correct for our use case.\n\nAlso checking: touching endpoints means [1,3] and [3,5] merge. My condition `current[0] <= last[1]` handles this since 3 <= 3 is true.\n\nThis looks good. Let me format the JSON properly.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 81, "total_tokens": 1071, "completion_tokens": 990, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 857}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "binary-search", "passed": true, "validation_stdout": "passed\n", "validation_stderr": "", "response": {"id": "chatcmpl-b764c227105ec2c6", "object": "chat.completion", "created": 1789741990, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": "\n\n{\"code\": \"def lower_bound(nums, target):\\n lo = 0\\n hi = len(nums)\\n while lo < hi:\\n mid = (lo + hi) // 2\\n if nums[mid] < target:\\n lo = mid + 1\\n else:\\n hi = mid\\n return lo\"}", "refusal": null, "annotations": null, "audio": null, "function_call": null, "reasoning": "The user wants a Python function `lower_bound` that finds the index of the first element >= target in a sorted list `nums`, or `len(nums)` if none exists.\n\nConstraints:\n- Return ONLY a JSON object with a \"code\" string\n- No imports, type annotations, decorators, top-level statements, or helper functions\n- Allowed builtins: sorted, len, range, min, max, list, enumerate, sum\n- Allowed methods: append, sort, copy\n\nLet me write a binary search implementation for lower_bound:\n\n```python\ndef lower_bound(nums, target):\n lo = 0\n hi = len(nums)\n while lo < hi:\n mid = (lo + hi) // 2\n if nums[mid] < target:\n lo = mid + 1\n else:\n hi = mid\n return lo\n```\n\nThis is a standard binary search for lower bound. Let me check constraints:\n- No imports ✓\n- No type annotations ✓\n- No decorators ✓\n- No top-level statements ✓\n- No helper functions ✓\n- Uses `len` which is allowed ✓\n- Uses basic operators and comparisons ✓\n\nNow I need to wrap this in a JSON object with a \"code\" string.\n"}, "logprobs": null, "finish_reason": "stop", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 92, "total_tokens": 438, "completion_tokens": 346, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 269}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
|
{"name": "tool-arguments", "passed": true, "response": {"id": "chatcmpl-82799dc20b39028e", "object": "chat.completion", "created": 1789741993, "model": "qwen3.8-flash-next", "choices": [{"index": 0, "message": {"role": "assistant", "content": null, "refusal": null, "annotations": null, "audio": null, "function_call": null, "tool_calls": [{"id": "chatcmpl-tool-a38851c145f4f076", "type": "function", "function": {"name": "create_ticket", "arguments": "{\"title\": \"GPU cooling failure\", \"priority\": \"urgent\", \"asset\": \"GPU-092\"}"}}], "reasoning": "The user wants me to create a ticket with specific parameters:\n- title: \"GPU cooling failure\" (exactly)\n- priority: \"urgent\"\n- asset: \"GPU-092\" (exactly)\n\nThis is straightforward - I'll call the create_ticket function with these exact values.\n"}, "logprobs": null, "finish_reason": "tool_calls", "stop_reason": null, "token_ids": null, "routed_experts": null}], "service_tier": null, "system_fingerprint": "vllm-0.3.1.dev3+g0bfc7a15d-9e1c6e32", "usage": {"prompt_tokens": 325, "total_tokens": 447, "completion_tokens": 122, "prompt_tokens_details": null, "completion_tokens_details": {"reasoning_tokens": 65}}, "prompt_logprobs": null, "prompt_token_ids": null, "prompt_text": null, "kv_transfer_params": null, "ec_transfer_params": null, "metrics": null}}
|
||||||
File diff suppressed because one or more lines are too long
@@ -0,0 +1,589 @@
|
|||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347]
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347] █ █ █▄ ▄█
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347] ▄▄ ▄█ █ █ █ ▀▄▀ █ version 0.3.1.dev3+g0bfc7a15d
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347] █▄█▀ █ █ █ █ model /model
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347] ▀▀ ▀▀▀▀▀ ▀▀▀▀▀ ▀ ▀
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:347]
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [api_utils.py:286] non-default args: {'model_tag': '/model', 'enable_auto_tool_choice': True, 'tool_call_parser': 'qwen3_xml', 'host': '0.0.0.0', 'api_key': '***', 'model': '/model', 'dtype': 'bfloat16', 'max_model_len': 131072, 'served_model_name': ['qwen3.8-flash-next'], 'load_format': 'safetensors', 'reasoning_parser': 'qwen3', 'gpu_memory_utilization': 0.985, 'kv_cache_dtype': 'fp8', 'enable_prefix_caching': True, 'max_num_batched_tokens': 2048, 'max_num_seqs': 1, 'enable_chunked_prefill': True, 'enable_flashinfer_autotune': False, 'speculative_config': {'method': 'mtp', 'num_speculative_tokens': 2}, 'compilation_config': {'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': [], 'ir_enable_torch_wrap': None, 'splitting_ops': None, 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': None, 'compile_ranges_endpoints': None, 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL: 2>, 'cudagraph_num_of_warmups': 0, 'cudagraph_capture_sizes': [1, 3], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': None, 'pass_config': {}, 'max_cudagraph_capture_size': None, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': None, 'static_all_moe_layers': []}, 'engram_config': EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [model.py:691] Resolved architecture: Qwen4ExpForConditionalGeneration
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:09 [model.py:2024] Using max model len 131072
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [cache.py:345] Using fp8 data type to store kv cache. It reduces the GPU memory footprint and boosts the performance. Meanwhile, it may cause accuracy drop without a proper scaling factor
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [model.py:691] Resolved architecture: Qwen4ExpMTP
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [model.py:2024] Using max model len 262144
|
||||||
|
(APIServer pid=1) WARNING 09-18 14:14:13 [speculative.py:1360] Enabling num_speculative_tokens > 1 will run multiple times of forward on same MTP layer,which may result in lower acceptance rate
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [speculative.py:1653] Overriding draft model max model len from 262144 to 131072
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [config.py:625] Mamba cache mode is set to 'align' for Qwen4ExpForConditionalGeneration by default when prefix caching is enabled
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [vllm.py:1271] Resolved Engram configuration: EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [vllm.py:781] Auto-enabling VLLM_USE_BREAKABLE_CUDAGRAPH=1. Set VLLM_USE_BREAKABLE_CUDAGRAPH=0 to opt out.
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [kernel.py:408] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native'])
|
||||||
|
(APIServer pid=1) WARNING 09-18 14:14:13 [vllm.py:2152] max_num_scheduled_tokens is set to 2048 based on the speculative decoding settings. This may lead to suboptimal performance. Consider increasing max_num_batched_tokens to accommodate the additional draft token slots, or decrease num_speculative_tokens.
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:13 [compilation.py:331] Enabled custom fusions: norm_quant, act_quant
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:25 [core.py:123] Initializing a V1 LLM engine (v0.3.1.dev3+g0bfc7a15d) with config: model='/model', speculative_config=SpeculativeConfig(method='mtp', model='/model', num_spec_tokens=2), tokenizer='/model', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=False, dtype=torch.bfloat16, max_seq_len=131072, download_dir=None, load_format=safetensors, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=modelopt_mixed, quantization_config=None, enforce_eager=False, enable_return_routed_experts=False, kv_cache_dtype=fp8, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='qwen3', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, per_request_spec_decode_metrics='none', kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False, jit_monitor_mode='warn', jit_monitor_verbose=False), seed=0, served_model_name=qwen3.8-flash-next, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['+quant_fp8', 'all', '+quant_fp8'], 'ir_enable_torch_wrap': False, 'splitting_ops': [], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': [], 'compile_ranges_endpoints': [2048], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.FULL: 2>, 'cudagraph_num_of_warmups': 1, 'cudagraph_capture_sizes': [1, 3], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': True, 'fuse_act_quant': True, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False, 'enable_qk_norm_rope_fusion': False, 'fuse_rope_kvcache_cat_mla': False, 'fuse_act_padding': False, 'fuse_qk_norm_rope_kvcache': False}, 'max_cudagraph_capture_size': 3, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native']), enable_flashinfer_autotune=False, enable_cutedsl_warmup=True, enable_jit_warmup=True, moe_backend='auto', sparse_indexer_topk_backend='auto', linear_backend='auto', linear_backend_per_quant=None)
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:26 [parallel_state.py:1825] world_size=1 rank=0 local_rank=0 distributed_init_method=file:///tmp/vllm_dist_ed11f4f25e124a16965c184de0adfebf backend=nccl
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:26 [parallel_state.py:2269] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, ETP rank 0, EP rank 0, EPLB rank N/A
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:26 [gpu_worker.py:441] Using V2 Model Runner
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:27 [model_runner.py:387] Loading model from scratch...
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:27 [cuda.py:595] Using backend AttentionBackendEnum.FLASH_ATTN for vit attention
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:27 [mm_encoder_attention.py:372] Using AttentionBackendEnum.FLASH_ATTN for MMEncoderAttention.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:27 [qwen_gdn_linear_attn.py:176] Using FlashInfer GDN prefill kernel (requested=auto, head_k_dim=128).
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:27 [qwen_gdn_linear_attn.py:528] GDN decode kernel: cuda
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:14:29 [nvfp4.py:302] Using 'FLASHINFER_CUTLASS' NvFp4 MoE backend out of potential backends: ['FLASHINFER_TRTLLM', 'FLASHINFER_CUTEDSL', 'FLASHINFER_CUTEDSL_BATCHED', 'FLASHINFER_CUTLASS', 'VLLM_CUTLASS', 'MARLIN', 'HUMMING', 'EMULATION'].
|
||||||
|
(APIServer pid=1) [transformers] Qwen3VL video processing does not apply the per-frame pixel cap the reference implementation (qwen-vl-utils) applies, so some videos cost far more tokens than they would there. In v5.22 the capped behavior will become the default and `cap_pixels_per_frame` will be removed. Pass `cap_pixels_per_frame=True` to adopt the reference behavior now, or `False` to keep the current behavior and silence this warning.
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:31 [base.py:261] Multi-modal warmup completed in 12.320s
|
||||||
|
(APIServer pid=1) INFO 09-18 14:14:33 [base.py:261] Readonly multi-modal warmup completed in 1.302s
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:03 [ngram_embedding.py:720] Initialized PLE embedding language_model.model.layers.1.ple.ple_embedding.ngram_embedding: quantization_method=Qwen4ExpPLEFp8EmbeddingMethod, weight_dtype=torch.float8_e4m3fn, weight_device=cpu, pinned=True
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:03 [flash_attn.py:1115] Using FlashAttention version 2
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:15:03 [compilation.py:1350] Op 'quant_fp8' not present in model, enabling with '+quant_fp8' has no effect
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:03 [weight_utils.py:900] Filesystem type for checkpoints: EXT4. Checkpoint size: 123.57 GiB. Available RAM: 142.31 GiB.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:03 [weight_utils.py:923] Auto-prefetch is disabled because the filesystem (EXT4) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 0% Completed | 0/11 [00:00<?, ?it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 9% Completed | 1/11 [00:01<00:16, 1.63s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 18% Completed | 2/11 [00:06<00:33, 3.74s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 27% Completed | 3/11 [00:12<00:36, 4.52s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 36% Completed | 4/11 [00:17<00:34, 4.87s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 45% Completed | 5/11 [00:23<00:30, 5.11s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 55% Completed | 6/11 [00:28<00:26, 5.26s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 64% Completed | 7/11 [00:34<00:21, 5.36s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 73% Completed | 8/11 [00:40<00:16, 5.47s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 82% Completed | 9/11 [00:41<00:08, 4.20s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:42<00:00, 2.38s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:42<00:00, 3.83s/it]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:45 [default_loader.py:430] Loading weights took 42.29 seconds
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:45 [nvfp4.py:611] Using MoEPrepareAndFinalizeNoDPEPModular
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:46 [vllm.py:1271] Resolved Engram configuration: EngramConfig(cpu_offload=True, embedding_across_dp=False, dp_shared_memory=False)
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:46 [kernel.py:408] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native'])
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:15:46 [vllm.py:2152] max_num_scheduled_tokens is set to 2048 based on the speculative decoding settings. This may lead to suboptimal performance. Consider increasing max_num_batched_tokens to accommodate the additional draft token slots, or decrease num_speculative_tokens.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:46 [compilation.py:331] Enabled custom fusions: norm_quant, act_quant
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:46 [fp8.py:433] Using DEEPGEMM Fp8 MoE backend out of potential backends: ['AITER', 'FLASHINFER_TRTLLM', 'FLASHINFER_CUTLASS', 'DEEPGEMM', 'TRITON', 'MARLIN', 'HUMMING', 'BATCHED_DEEPGEMM', 'BATCHED_TRITON', 'XPU', 'CPU', 'HPC'].
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:47 [weight_utils.py:900] Filesystem type for checkpoints: EXT4. Checkpoint size: 123.57 GiB. Available RAM: 142.17 GiB.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 0% Completed | 0/11 [00:00<?, ?it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 18% Completed | 2/11 [00:00<00:01, 5.13it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 27% Completed | 3/11 [00:00<00:01, 4.03it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 36% Completed | 4/11 [00:01<00:01, 3.63it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 45% Completed | 5/11 [00:01<00:01, 3.41it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 55% Completed | 6/11 [00:01<00:01, 3.30it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 64% Completed | 7/11 [00:02<00:01, 3.24it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 73% Completed | 8/11 [00:02<00:00, 3.19it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 82% Completed | 9/11 [00:02<00:00, 3.69it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:02<00:00, 3.89it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Loading safetensors checkpoint shards: 100% Completed | 11/11 [00:02<00:00, 3.68it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:50 [default_loader.py:430] Loading weights took 3.00 seconds
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:50 [deep_gemm.py:196] deep_gemm not found in site-packages, trying vendored vllm.third_party.deep_gemm
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:50 [deep_gemm.py:223] DeepGEMM PDL enabled on vllm.third_party.deep_gemm.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:50 [deep_gemm.py:136] DeepGEMM E8M0 enabled on current platform.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:52 [fp8.py:733] Using MoEPrepareAndFinalizeNoDPEPModular
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:15:52 [speculator.py:235] Draft model Qwen4ExpMTP does not support external multimodal embeddings. Embeddings from the target model will not be passed to the drafter; using text-only draft inputs instead.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:53 [model_runner.py:419] Model loading took 76.36 GiB memory and 86.461433 seconds
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:53 [topk_topp_sampler.py:78] Using FlashInfer for top-p & top-k sampling.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:53 [interface.py:918] Setting attention block size to 3184 tokens to ensure that attention page size is >= mamba page size.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:53 [interface.py:942] Padding mamba page size by 0.38% to ensure that mamba page size and attention page size are exactly equal.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:53 [utils.py:320] Using BLNHC KV cache layout.
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] The `use_fast` parameter is deprecated and will be removed in a future version. Use `backend="torchvision"` instead of `use_fast=True`, or `backend="pil"` instead of `use_fast=False`.
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_interleaved', 'mrope_section'}
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:15:58 [encoder_runner.py:131] Encoder cache will be initialized with a budget of 16384 tokens, and profiled with 1 image items of the maximum feature size.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:20 [kv_cache_utils.py:2219] Speculative decoding (method=mtp) is enabled but no KV cache group could be identified as the draft model's.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:20 [compilation.py:1415] CUDAGraphMode.FULL is not supported with GDNAttentionBackend backend (support: AttentionCGSupport.UNIFORM_BATCH); setting cudagraph_mode=FULL_DECODE_ONLY
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:20 [speculator.py:119] Fused multi-step draft decode is not supported by attention backend(s) QWEN4_EXP_EXP_QSA_STATE; falling back to rebuilding attention metadata between draft steps.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:01<00:00, 1.83s/it]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:01<00:00, 1.83s/it]
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:22 [speculator.py:150] Capturing model for speculator...
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing prefill CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing prefill CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 2.17it/s]
|
||||||
|
Capturing prefill CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 2.17it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing decode CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing decode CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 5.69it/s]
|
||||||
|
Capturing decode CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 5.69it/s]
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:23 [model_runner.py:1057] Graph capturing finished in 3 secs, took 0.14 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [gpu_worker.py:641] Available KV cache memory: 2.78 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [gpu_worker.py:656] CUDA graph memory profiling is enabled (default since v0.21.0). The current --gpu-memory-utilization=0.9850 is equivalent to --gpu-memory-utilization=0.9833 without CUDA graph memory profiling. To maintain the same effective KV cache size as before, increase --gpu-memory-utilization to 0.9867. To disable, set VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=0.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:24 [kv_cache_utils.py:2219] Speculative decoding (method=mtp) is enabled but no KV cache group could be identified as the draft model's.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [kv_cache_utils.py:2404] GPU KV cache size: 146,622 tokens, Maximum concurrency for 131,072 tokens per request: 1.12x
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [kernel_warmup.py:171] JIT kernel warmup starting.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [kernel_warmup.py:184] JIT kernel warmup finished in 0.00s.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [qwen_vl_triton_warmup.py:57] Warmed position embedding and vision rotary kernels on grids=[(1, 16, 16), (1, 16, 2), (1, 2, 16), (1, 2, 2)].
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [qwen_vl_triton_warmup.py:98] Warmed M-RoPE Triton kernels.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:24 [mamba_triton_warmup.py:42] Warmed Mamba batch_memcpy_kernel.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:25 [qwen4_exp_qsa_warmup.py:71] Warmed up Qwen4Exp QSA decode kernels: ((1, 1), (2, 1), (3, 1)).
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:30 [qwen4_exp_qsa_warmup.py:85] Warmed up Qwen4Exp QSA sparse attention kernels: ((32, 2, 1), (32, 4, 4), (64, 1, 2), (64, 4, 4), (64, 8, 4), (64, 33, 8), (128, 4, 4), (128, 8, 4)).
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:30 [kernel_warmup.py:254] Skipping FlashInfer autotune because it is disabled.
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 9.91it/s]
|
||||||
|
Capturing CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 9.89it/s]
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:39 [speculator.py:150] Capturing model for speculator...
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing prefill CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing prefill CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 118.66it/s]
|
||||||
|
(EngineCore pid=113)
|
||||||
|
Capturing decode CUDA graphs (FULL): 0%| | 0/1 [00:00<?, ?it/s]
|
||||||
|
Capturing decode CUDA graphs (FULL): 100%|██████████| 1/1 [00:00<00:00, 176.98it/s]
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:39 [model_runner.py:1057] Graph capturing finished in 1 secs, took 0.13 GiB
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:39 [gpu_worker.py:824] CUDA graph pool memory: 0.13 GiB (actual), 0.14 GiB (estimated), difference: 0.01 GiB (5.8%).
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:39 [gpu_worker.py:887] Free memory on device (82.59/83.05 GiB) on startup. Desired GPU memory utilization is (0.985, 81.8 GiB). Actual usage is 77.85 GiB for consumed memory (weights + non-torch), 1.17 GiB for peak activation, and 0.13 GiB for CUDAGraph memory. Replace gpu_memory_utilization config with `--kv-cache-memory=2685284312` (2.5 GiB) to fit into requested memory, or `--kv-cache-memory=3531951104` (3.29 GiB) to fully utilize gpu memory. Current kv cache memory in use is 2.78 GiB.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:40 [jit_monitor.py:84] Kernel JIT monitor activated; monitored JIT compilations during inference will use mode=warn.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:41 [torch_utils.py:274] OMP_NUM_THREADS=8 is set; leaving Torch threads at 8 for serving. Multi-threaded torch CPU ops during serving can degrade performance through spin-wait contention and cgroup CPU-quota throttling.
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:41 [core.py:380] init engine (profile, create kv cache, warmup model) took 47.40 s
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:41 [kv_cache_utils.py:762] kv cache group sizes [3184, 3184, 3184, 3184, 8, 3184]
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:41 [kv_cache_utils.py:763] kv lcm block sizes 3184
|
||||||
|
(EngineCore pid=113) INFO 09-18 14:16:41 [kernel.py:408] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'], gelu_and_mul_sparse=['triton', 'native'])
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [entry.py:132] Supported tasks: ['generate']
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [factories.py:76] Scale-out endpoints are disabled. Set --enable-scale-out to enable them.
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [parser_manager.py:34] "auto" tool choice has been enabled.
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) [transformers] Unrecognized keys in `rope_parameters` for 'rope_type'='default': {'mrope_section', 'mrope_interleaved'}
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [hf.py:642] Detected the chat template content format to be 'openai'. You can set `--chat-template-content-format` to override this.
|
||||||
|
(APIServer pid=1) WARNING 09-18 14:16:41 [model.py:1769] Default vLLM sampling parameters have been overridden by the model's `generation_config.json`: `{'temperature': 1.0, 'top_k': 20, 'top_p': 0.95}`. If this is not intended, please relaunch vLLM instance with `--generation-config vllm`.
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [entry.py:136] Starting vLLM server on http://0.0.0.0:8000
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:60] Available routes are:
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /openapi.json, Methods: HEAD, GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /docs, Methods: HEAD, GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /docs/oauth2-redirect, Methods: HEAD, GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /redoc, Methods: HEAD, GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /load, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /version, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /health, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /metrics, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /tokenize, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /detokenize, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/models, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /ping, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /ping, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /invocations, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/chat/completions, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/chat/completions/batch, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/responses, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/responses/{response_id}, Methods: GET
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/responses/{response_id}/cancel, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/completions, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/messages, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /v1/messages/count_tokens, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /generative_scoring, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /scale_elastic_ep, Methods: POST
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:41 [launcher.py:69] Route: /is_scaling_elastic_ep, Methods: POST
|
||||||
|
(APIServer pid=1) INFO: Started server process [1]
|
||||||
|
(APIServer pid=1) INFO: Waiting for application startup.
|
||||||
|
(APIServer pid=1) INFO: Application startup complete.
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:52136 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36256 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36262 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:46 [jit_monitor.py:140] Triton kernel JIT compilation during inference: layer_norm_fwd_kernel. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:46 [jit_monitor.py:140] Triton kernel JIT compilation during inference: _count_expert_num_tokens. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:46 [jit_monitor.py:140] Triton kernel JIT compilation during inference: _compute_local_logits_stats_kernel. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:46 [jit_monitor.py:140] Triton kernel JIT compilation during inference: _rejection_kernel. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(EngineCore pid=113) WARNING 09-18 14:16:47 [jit_monitor.py:140] Triton kernel JIT compilation during inference: _resample_kernel. This causes a latency spike; consider extending warmup to cover this shape/config.
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36278 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36282 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36290 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36304 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36306 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36310 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36316 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36332 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36342 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36352 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:52 [loggers.py:323] Engine 000: Avg prompt throughput: 53.5 tokens/s, Avg generation throughput: 60.9 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 0.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:16:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.91, Accepted throughput: 39.90 tokens/s, Drafted throughput: 41.72 tokens/s, Accepted: 440 tokens, Drafted: 460 tokens, Per-position acceptance rate: 0.987, 0.926, Avg Draft acceptance rate: 95.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36364 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36378 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36380 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33586 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33600 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
[rank0]:[W918 14:16:56.003832297 CUDACachingAllocator.cpp:3933] memory allocation failed with OOM on device 0 while trying to allocate 377487360 bytes (free: 64946176, total: 89173131264).
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33614 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33630 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:02 [loggers.py:323] Engine 000: Avg prompt throughput: 2790.6 tokens/s, Avg generation throughput: 72.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.72, Accepted throughput: 45.70 tokens/s, Drafted throughput: 53.00 tokens/s, Accepted: 457 tokens, Drafted: 530 tokens, Per-position acceptance rate: 0.925, 0.800, Avg Draft acceptance rate: 86.2%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33642 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:12 [loggers.py:323] Engine 000: Avg prompt throughput: 7.7 tokens/s, Avg generation throughput: 124.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.27, Accepted throughput: 69.90 tokens/s, Drafted throughput: 110.19 tokens/s, Accepted: 699 tokens, Drafted: 1102 tokens, Per-position acceptance rate: 0.737, 0.532, Avg Draft acceptance rate: 63.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:35366 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43852 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:22 [loggers.py:323] Engine 000: Avg prompt throughput: 7.7 tokens/s, Avg generation throughput: 118.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.14, Accepted throughput: 62.90 tokens/s, Drafted throughput: 110.40 tokens/s, Accepted: 629 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.707, 0.433, Avg Draft acceptance rate: 57.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 128.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.30, Accepted throughput: 72.60 tokens/s, Drafted throughput: 111.60 tokens/s, Accepted: 726 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.758, 0.543, Avg Draft acceptance rate: 65.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44946 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:42 [loggers.py:323] Engine 000: Avg prompt throughput: 7.7 tokens/s, Avg generation throughput: 119.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 64.09 tokens/s, Drafted throughput: 110.38 tokens/s, Accepted: 641 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.707, 0.455, Avg Draft acceptance rate: 58.1%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:40726 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 123.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:17:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.22, Accepted throughput: 68.10 tokens/s, Drafted throughput: 111.40 tokens/s, Accepted: 681 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.727, 0.496, Avg Draft acceptance rate: 61.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:41494 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51114 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:02 [loggers.py:323] Engine 000: Avg prompt throughput: 15.8 tokens/s, Avg generation throughput: 124.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.27, Accepted throughput: 69.80 tokens/s, Drafted throughput: 109.80 tokens/s, Accepted: 698 tokens, Drafted: 1098 tokens, Per-position acceptance rate: 0.754, 0.517, Avg Draft acceptance rate: 63.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53922 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:12 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 129.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.32, Accepted throughput: 73.50 tokens/s, Drafted throughput: 111.00 tokens/s, Accepted: 735 tokens, Drafted: 1110 tokens, Per-position acceptance rate: 0.766, 0.559, Avg Draft acceptance rate: 66.2%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:57802 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 127.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.28, Accepted throughput: 71.50 tokens/s, Drafted throughput: 111.80 tokens/s, Accepted: 715 tokens, Drafted: 1118 tokens, Per-position acceptance rate: 0.758, 0.521, Avg Draft acceptance rate: 64.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:36444 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:32 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 128.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.31, Accepted throughput: 72.70 tokens/s, Drafted throughput: 110.80 tokens/s, Accepted: 727 tokens, Drafted: 1108 tokens, Per-position acceptance rate: 0.765, 0.547, Avg Draft acceptance rate: 65.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 129.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.32, Accepted throughput: 73.70 tokens/s, Drafted throughput: 111.79 tokens/s, Accepted: 737 tokens, Drafted: 1118 tokens, Per-position acceptance rate: 0.764, 0.555, Avg Draft acceptance rate: 65.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38818 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:34668 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:40728 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:52 [loggers.py:323] Engine 000: Avg prompt throughput: 15.8 tokens/s, Avg generation throughput: 120.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:18:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.20, Accepted throughput: 65.80 tokens/s, Drafted throughput: 109.99 tokens/s, Accepted: 658 tokens, Drafted: 1100 tokens, Per-position acceptance rate: 0.709, 0.487, Avg Draft acceptance rate: 59.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 122.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.20, Accepted throughput: 67.00 tokens/s, Drafted throughput: 111.40 tokens/s, Accepted: 670 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.716, 0.487, Avg Draft acceptance rate: 60.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:50984 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:12 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 119.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 64.20 tokens/s, Drafted throughput: 110.80 tokens/s, Accepted: 642 tokens, Drafted: 1108 tokens, Per-position acceptance rate: 0.702, 0.457, Avg Draft acceptance rate: 57.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:57380 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37540 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:22 [loggers.py:323] Engine 000: Avg prompt throughput: 7.9 tokens/s, Avg generation throughput: 122.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.22, Accepted throughput: 67.59 tokens/s, Drafted throughput: 110.59 tokens/s, Accepted: 676 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.714, 0.508, Avg Draft acceptance rate: 61.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 121.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.17, Accepted throughput: 65.50 tokens/s, Drafted throughput: 111.59 tokens/s, Accepted: 655 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.710, 0.464, Avg Draft acceptance rate: 58.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43060 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:42 [loggers.py:323] Engine 000: Avg prompt throughput: 7.5 tokens/s, Avg generation throughput: 124.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.26, Accepted throughput: 69.60 tokens/s, Drafted throughput: 110.60 tokens/s, Accepted: 696 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.741, 0.517, Avg Draft acceptance rate: 62.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:45568 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 137.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:19:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.47, Accepted throughput: 81.90 tokens/s, Drafted throughput: 111.20 tokens/s, Accepted: 819 tokens, Drafted: 1112 tokens, Per-position acceptance rate: 0.831, 0.642, Avg Draft acceptance rate: 73.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 150.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.1%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.71, Accepted throughput: 95.00 tokens/s, Drafted throughput: 110.80 tokens/s, Accepted: 950 tokens, Drafted: 1108 tokens, Per-position acceptance rate: 0.919, 0.796, Avg Draft acceptance rate: 85.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 145.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.1%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.63, Accepted throughput: 90.20 tokens/s, Drafted throughput: 110.79 tokens/s, Accepted: 902 tokens, Drafted: 1108 tokens, Per-position acceptance rate: 0.888, 0.740, Avg Draft acceptance rate: 81.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41446 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 138.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.6%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.51, Accepted throughput: 83.29 tokens/s, Drafted throughput: 110.59 tokens/s, Accepted: 833 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.837, 0.669, Avg Draft acceptance rate: 75.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 134.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.6%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.43, Accepted throughput: 79.10 tokens/s, Drafted throughput: 110.39 tokens/s, Accepted: 791 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.813, 0.620, Avg Draft acceptance rate: 71.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 134.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.6%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.45, Accepted throughput: 79.80 tokens/s, Drafted throughput: 110.19 tokens/s, Accepted: 798 tokens, Drafted: 1102 tokens, Per-position acceptance rate: 0.815, 0.633, Avg Draft acceptance rate: 72.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:38588 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 131.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 26.2%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:20:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.43, Accepted throughput: 77.00 tokens/s, Drafted throughput: 108.00 tokens/s, Accepted: 770 tokens, Drafted: 1080 tokens, Per-position acceptance rate: 0.743, 0.683, Avg Draft acceptance rate: 71.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 154.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 26.2%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.88, Accepted throughput: 100.70 tokens/s, Drafted throughput: 107.40 tokens/s, Accepted: 1007 tokens, Drafted: 1074 tokens, Per-position acceptance rate: 0.952, 0.924, Avg Draft acceptance rate: 93.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 143.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 27.7%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.66, Accepted throughput: 89.40 tokens/s, Drafted throughput: 108.00 tokens/s, Accepted: 894 tokens, Drafted: 1080 tokens, Per-position acceptance rate: 0.833, 0.822, Avg Draft acceptance rate: 82.8%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:42148 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 151.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 27.7%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.80, Accepted throughput: 97.59 tokens/s, Drafted throughput: 108.19 tokens/s, Accepted: 976 tokens, Drafted: 1082 tokens, Per-position acceptance rate: 0.906, 0.898, Avg Draft acceptance rate: 90.2%
|
||||||
|
(APIServer pid=1) [transformers] Token indices sequence length is longer than the specified maximum sequence length for this model (268298 > 262144). Running this sequence through the model will result in indexing errors
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48854 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48862 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48874 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48886 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48894 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48902 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48914 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 140.5 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.86, Accepted throughput: 91.39 tokens/s, Drafted throughput: 98.39 tokens/s, Accepted: 914 tokens, Drafted: 984 tokens, Per-position acceptance rate: 0.929, 0.929, Avg Draft acceptance rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48926 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48928 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48934 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48948 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48950 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48964 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48968 - "POST /tokenize HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48976 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 67.7%, Prefix cache hit rate: 0.0%, MM cache hit rate: 66.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49396 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38790 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38796 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38802 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:52 [loggers.py:323] Engine 000: Avg prompt throughput: 13599.9 tokens/s, Avg generation throughput: 37.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 32.3%, Prefix cache hit rate: 46.6%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:21:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.80, Accepted throughput: 11.95 tokens/s, Drafted throughput: 13.30 tokens/s, Accepted: 239 tokens, Drafted: 266 tokens, Per-position acceptance rate: 0.940, 0.857, Avg Draft acceptance rate: 89.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 73.8%, Prefix cache hit rate: 46.6%, MM cache hit rate: 71.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43834 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43840 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43848 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43858 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43874 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43878 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:43890 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:12 [loggers.py:323] Engine 000: Avg prompt throughput: 13594.6 tokens/s, Avg generation throughput: 70.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.1%, Prefix cache hit rate: 52.5%, MM cache hit rate: 77.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.77, Accepted throughput: 22.55 tokens/s, Drafted throughput: 25.50 tokens/s, Accepted: 451 tokens, Drafted: 510 tokens, Per-position acceptance rate: 0.929, 0.839, Avg Draft acceptance rate: 88.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:51984 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:58388 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:22 [loggers.py:323] Engine 000: Avg prompt throughput: 1215.2 tokens/s, Avg generation throughput: 113.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 52.5%, MM cache hit rate: 77.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.29, Accepted throughput: 63.79 tokens/s, Drafted throughput: 99.19 tokens/s, Accepted: 638 tokens, Drafted: 992 tokens, Per-position acceptance rate: 0.754, 0.532, Avg Draft acceptance rate: 64.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52418 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:32 [loggers.py:323] Engine 000: Avg prompt throughput: 8.6 tokens/s, Avg generation throughput: 139.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 52.5%, MM cache hit rate: 77.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.53, Accepted throughput: 84.50 tokens/s, Drafted throughput: 110.60 tokens/s, Accepted: 845 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.848, 0.680, Avg Draft acceptance rate: 76.4%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 134.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 52.5%, MM cache hit rate: 77.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.40, Accepted throughput: 78.30 tokens/s, Drafted throughput: 112.00 tokens/s, Accepted: 783 tokens, Drafted: 1120 tokens, Per-position acceptance rate: 0.811, 0.588, Avg Draft acceptance rate: 69.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:56790 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53910 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 33.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 58.5%, Prefix cache hit rate: 44.1%, MM cache hit rate: 77.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:22:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.42, Accepted throughput: 19.70 tokens/s, Drafted throughput: 27.80 tokens/s, Accepted: 197 tokens, Drafted: 278 tokens, Per-position acceptance rate: 0.799, 0.619, Avg Draft acceptance rate: 70.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47694 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47700 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:02 [loggers.py:323] Engine 000: Avg prompt throughput: 12912.6 tokens/s, Avg generation throughput: 24.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 30.8%, Prefix cache hit rate: 43.3%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.74, Accepted throughput: 15.50 tokens/s, Drafted throughput: 17.80 tokens/s, Accepted: 155 tokens, Drafted: 178 tokens, Per-position acceptance rate: 0.921, 0.820, Avg Draft acceptance rate: 87.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47708 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:12 [loggers.py:323] Engine 000: Avg prompt throughput: 1215.4 tokens/s, Avg generation throughput: 118.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 43.3%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.24, Accepted throughput: 65.70 tokens/s, Drafted throughput: 105.99 tokens/s, Accepted: 657 tokens, Drafted: 1060 tokens, Per-position acceptance rate: 0.743, 0.496, Avg Draft acceptance rate: 62.0%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:53052 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59822 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:22 [loggers.py:323] Engine 000: Avg prompt throughput: 8.4 tokens/s, Avg generation throughput: 120.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 43.3%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.18, Accepted throughput: 65.40 tokens/s, Drafted throughput: 110.39 tokens/s, Accepted: 654 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.716, 0.469, Avg Draft acceptance rate: 59.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 121.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 43.3%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.18, Accepted throughput: 66.00 tokens/s, Drafted throughput: 111.60 tokens/s, Accepted: 660 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.704, 0.478, Avg Draft acceptance rate: 59.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:34388 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 61.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 46.2%, Prefix cache hit rate: 37.4%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.06, Accepted throughput: 31.80 tokens/s, Drafted throughput: 59.99 tokens/s, Accepted: 318 tokens, Drafted: 600 tokens, Per-position acceptance rate: 0.673, 0.387, Avg Draft acceptance rate: 53.0%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:50974 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:52 [loggers.py:323] Engine 000: Avg prompt throughput: 12598.6 tokens/s, Avg generation throughput: 2.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 81.5%, Prefix cache hit rate: 37.4%, MM cache hit rate: 81.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:23:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.80, Accepted throughput: 1.80 tokens/s, Drafted throughput: 2.00 tokens/s, Accepted: 18 tokens, Drafted: 20 tokens, Per-position acceptance rate: 0.900, 0.900, Avg Draft acceptance rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:50664 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38410 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38412 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:02 [loggers.py:323] Engine 000: Avg prompt throughput: 1529.0 tokens/s, Avg generation throughput: 105.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 36.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.35, Accepted throughput: 60.20 tokens/s, Drafted throughput: 89.20 tokens/s, Accepted: 602 tokens, Drafted: 892 tokens, Per-position acceptance rate: 0.791, 0.558, Avg Draft acceptance rate: 67.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 118.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 36.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.13, Accepted throughput: 62.90 tokens/s, Drafted throughput: 111.40 tokens/s, Accepted: 629 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.689, 0.440, Avg Draft acceptance rate: 56.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38508 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:37090 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:22 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 123.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 36.8%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.23, Accepted throughput: 67.80 tokens/s, Drafted throughput: 110.60 tokens/s, Accepted: 678 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.732, 0.494, Avg Draft acceptance rate: 61.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:55060 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 100.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 36.9%, Prefix cache hit rate: 32.5%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.33, Accepted throughput: 57.60 tokens/s, Drafted throughput: 86.60 tokens/s, Accepted: 576 tokens, Drafted: 866 tokens, Per-position acceptance rate: 0.762, 0.568, Avg Draft acceptance rate: 66.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 78.5%, Prefix cache hit rate: 32.5%, MM cache hit rate: 84.6%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41864 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44650 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44654 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44658 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:52 [loggers.py:323] Engine 000: Avg prompt throughput: 14128.6 tokens/s, Avg generation throughput: 77.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 32.0%, MM cache hit rate: 86.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:24:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.37, Accepted throughput: 22.20 tokens/s, Drafted throughput: 32.40 tokens/s, Accepted: 444 tokens, Drafted: 648 tokens, Per-position acceptance rate: 0.765, 0.605, Avg Draft acceptance rate: 68.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 130.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 32.0%, MM cache hit rate: 86.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.33, Accepted throughput: 74.49 tokens/s, Drafted throughput: 111.79 tokens/s, Accepted: 745 tokens, Drafted: 1118 tokens, Per-position acceptance rate: 0.767, 0.565, Avg Draft acceptance rate: 66.6%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52324 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:12 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 124.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 32.0%, MM cache hit rate: 86.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.25, Accepted throughput: 69.30 tokens/s, Drafted throughput: 110.99 tokens/s, Accepted: 693 tokens, Drafted: 1110 tokens, Per-position acceptance rate: 0.737, 0.512, Avg Draft acceptance rate: 62.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:54114 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47722 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 112.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 32.3%, Prefix cache hit rate: 28.7%, MM cache hit rate: 86.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.32, Accepted throughput: 63.90 tokens/s, Drafted throughput: 96.79 tokens/s, Accepted: 639 tokens, Drafted: 968 tokens, Per-position acceptance rate: 0.756, 0.564, Avg Draft acceptance rate: 66.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 75.4%, Prefix cache hit rate: 28.7%, MM cache hit rate: 86.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56320 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56330 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56334 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:42 [loggers.py:323] Engine 000: Avg prompt throughput: 14128.9 tokens/s, Avg generation throughput: 67.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 28.3%, MM cache hit rate: 88.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.45, Accepted throughput: 19.80 tokens/s, Drafted throughput: 27.30 tokens/s, Accepted: 396 tokens, Drafted: 546 tokens, Per-position acceptance rate: 0.806, 0.645, Avg Draft acceptance rate: 72.5%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:34304 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 126.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 28.3%, MM cache hit rate: 88.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:25:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.27, Accepted throughput: 70.90 tokens/s, Drafted throughput: 111.80 tokens/s, Accepted: 709 tokens, Drafted: 1118 tokens, Per-position acceptance rate: 0.757, 0.512, Avg Draft acceptance rate: 63.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33198 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:02 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 117.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 28.3%, MM cache hit rate: 88.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.12, Accepted throughput: 62.09 tokens/s, Drafted throughput: 110.39 tokens/s, Accepted: 621 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.681, 0.444, Avg Draft acceptance rate: 56.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 130.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 28.3%, MM cache hit rate: 88.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.34, Accepted throughput: 74.39 tokens/s, Drafted throughput: 111.39 tokens/s, Accepted: 744 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.772, 0.564, Avg Draft acceptance rate: 66.8%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:52376 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:51278 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 69.2%, Prefix cache hit rate: 25.7%, MM cache hit rate: 88.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 1.80, Accepted throughput: 0.40 tokens/s, Drafted throughput: 1.00 tokens/s, Accepted: 4 tokens, Drafted: 10 tokens, Per-position acceptance rate: 0.600, 0.200, Avg Draft acceptance rate: 40.0%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56900 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56902 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:56906 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:32 [loggers.py:323] Engine 000: Avg prompt throughput: 14128.0 tokens/s, Avg generation throughput: 53.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 25.4%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.74, Accepted throughput: 33.90 tokens/s, Drafted throughput: 39.00 tokens/s, Accepted: 339 tokens, Drafted: 390 tokens, Per-position acceptance rate: 0.923, 0.815, Avg Draft acceptance rate: 86.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 112.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 25.4%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.01, Accepted throughput: 56.60 tokens/s, Drafted throughput: 111.59 tokens/s, Accepted: 566 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.658, 0.357, Avg Draft acceptance rate: 50.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:50340 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37702 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:52 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 117.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 25.4%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:26:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.12, Accepted throughput: 62.10 tokens/s, Drafted throughput: 110.80 tokens/s, Accepted: 621 tokens, Drafted: 1108 tokens, Per-position acceptance rate: 0.704, 0.417, Avg Draft acceptance rate: 56.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 120.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 25.4%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.17, Accepted throughput: 65.20 tokens/s, Drafted throughput: 111.40 tokens/s, Accepted: 652 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.707, 0.463, Avg Draft acceptance rate: 58.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:41528 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 45.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 53.8%, Prefix cache hit rate: 23.2%, MM cache hit rate: 89.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.25, Accepted throughput: 25.40 tokens/s, Drafted throughput: 40.80 tokens/s, Accepted: 254 tokens, Drafted: 408 tokens, Per-position acceptance rate: 0.745, 0.500, Avg Draft acceptance rate: 62.3%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:34370 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60904 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:22 [loggers.py:323] Engine 000: Avg prompt throughput: 12913.2 tokens/s, Avg generation throughput: 22.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 23.1%, Prefix cache hit rate: 23.2%, MM cache hit rate: 90.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.66, Accepted throughput: 14.10 tokens/s, Drafted throughput: 17.00 tokens/s, Accepted: 141 tokens, Drafted: 170 tokens, Per-position acceptance rate: 0.894, 0.765, Avg Draft acceptance rate: 82.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60920 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:33700 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:32 [loggers.py:323] Engine 000: Avg prompt throughput: 1215.4 tokens/s, Avg generation throughput: 98.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 23.0%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.09, Accepted throughput: 51.20 tokens/s, Drafted throughput: 93.60 tokens/s, Accepted: 512 tokens, Drafted: 936 tokens, Per-position acceptance rate: 0.660, 0.434, Avg Draft acceptance rate: 54.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44936 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:42 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 134.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 23.0%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.43, Accepted throughput: 79.30 tokens/s, Drafted throughput: 110.60 tokens/s, Accepted: 793 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.817, 0.617, Avg Draft acceptance rate: 71.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:45276 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 118.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 23.0%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:27:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.11, Accepted throughput: 62.10 tokens/s, Drafted throughput: 111.80 tokens/s, Accepted: 621 tokens, Drafted: 1118 tokens, Per-position acceptance rate: 0.699, 0.411, Avg Draft acceptance rate: 55.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:34630 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 76.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 43.1%, Prefix cache hit rate: 21.2%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 41.10 tokens/s, Drafted throughput: 70.60 tokens/s, Accepted: 411 tokens, Drafted: 706 tokens, Per-position acceptance rate: 0.711, 0.453, Avg Draft acceptance rate: 58.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 84.6%, Prefix cache hit rate: 21.2%, MM cache hit rate: 90.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47082 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37824 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49298 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:37832 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:22 [loggers.py:323] Engine 000: Avg prompt throughput: 14128.0 tokens/s, Avg generation throughput: 98.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 21.0%, MM cache hit rate: 91.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.41, Accepted throughput: 28.70 tokens/s, Drafted throughput: 40.60 tokens/s, Accepted: 574 tokens, Drafted: 812 tokens, Per-position acceptance rate: 0.793, 0.621, Avg Draft acceptance rate: 70.7%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 124.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 21.0%, MM cache hit rate: 91.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.24, Accepted throughput: 69.10 tokens/s, Drafted throughput: 111.20 tokens/s, Accepted: 691 tokens, Drafted: 1112 tokens, Per-position acceptance rate: 0.745, 0.498, Avg Draft acceptance rate: 62.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53742 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:42 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 111.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 21.0%, MM cache hit rate: 91.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.02, Accepted throughput: 56.50 tokens/s, Drafted throughput: 110.40 tokens/s, Accepted: 565 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.650, 0.373, Avg Draft acceptance rate: 51.2%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:49254 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:44080 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 111.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 33.8%, Prefix cache hit rate: 19.5%, MM cache hit rate: 91.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:28:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.40, Accepted throughput: 64.89 tokens/s, Drafted throughput: 92.59 tokens/s, Accepted: 649 tokens, Drafted: 926 tokens, Per-position acceptance rate: 0.803, 0.598, Avg Draft acceptance rate: 70.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 76.9%, Prefix cache hit rate: 19.5%, MM cache hit rate: 91.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53800 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53804 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53806 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:12 [loggers.py:323] Engine 000: Avg prompt throughput: 14128.1 tokens/s, Avg generation throughput: 75.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 19.4%, MM cache hit rate: 92.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.57, Accepted throughput: 23.05 tokens/s, Drafted throughput: 29.40 tokens/s, Accepted: 461 tokens, Drafted: 588 tokens, Per-position acceptance rate: 0.864, 0.704, Avg Draft acceptance rate: 78.4%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:51408 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 118.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 19.4%, MM cache hit rate: 92.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.13, Accepted throughput: 62.89 tokens/s, Drafted throughput: 111.59 tokens/s, Accepted: 629 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.703, 0.425, Avg Draft acceptance rate: 56.4%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60596 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:32 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 124.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 19.4%, MM cache hit rate: 92.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.25, Accepted throughput: 68.89 tokens/s, Drafted throughput: 110.59 tokens/s, Accepted: 689 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.732, 0.514, Avg Draft acceptance rate: 62.3%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 119.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 19.4%, MM cache hit rate: 92.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.15, Accepted throughput: 64.20 tokens/s, Drafted throughput: 111.20 tokens/s, Accepted: 642 tokens, Drafted: 1112 tokens, Per-position acceptance rate: 0.716, 0.439, Avg Draft acceptance rate: 57.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:60372 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:41996 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:52 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 11.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 66.2%, Prefix cache hit rate: 18.1%, MM cache hit rate: 92.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:29:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.23, Accepted throughput: 6.40 tokens/s, Drafted throughput: 10.40 tokens/s, Accepted: 64 tokens, Drafted: 104 tokens, Per-position acceptance rate: 0.769, 0.462, Avg Draft acceptance rate: 61.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59394 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59402 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59410 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:02 [loggers.py:323] Engine 000: Avg prompt throughput: 14127.4 tokens/s, Avg generation throughput: 41.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 18.0%, MM cache hit rate: 92.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.76, Accepted throughput: 26.00 tokens/s, Drafted throughput: 29.60 tokens/s, Accepted: 260 tokens, Drafted: 296 tokens, Per-position acceptance rate: 0.912, 0.845, Avg Draft acceptance rate: 87.8%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:12 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 117.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 18.0%, MM cache hit rate: 92.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.10, Accepted throughput: 61.50 tokens/s, Drafted throughput: 111.39 tokens/s, Accepted: 615 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.666, 0.438, Avg Draft acceptance rate: 55.2%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:43480 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:48952 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:22 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 119.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 18.0%, MM cache hit rate: 92.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 63.90 tokens/s, Drafted throughput: 110.39 tokens/s, Accepted: 639 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.699, 0.458, Avg Draft acceptance rate: 57.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 120.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 18.0%, MM cache hit rate: 92.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 65.00 tokens/s, Drafted throughput: 111.59 tokens/s, Accepted: 650 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.706, 0.459, Avg Draft acceptance rate: 58.2%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:50314 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 52.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.8%, Prefix cache hit rate: 16.9%, MM cache hit rate: 92.6%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 28.10 tokens/s, Drafted throughput: 48.40 tokens/s, Accepted: 281 tokens, Drafted: 484 tokens, Per-position acceptance rate: 0.665, 0.496, Avg Draft acceptance rate: 58.1%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:50034 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:58630 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:52 [loggers.py:323] Engine 000: Avg prompt throughput: 12598.1 tokens/s, Avg generation throughput: 13.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 16.8%, MM cache hit rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:30:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.71, Accepted throughput: 8.40 tokens/s, Drafted throughput: 9.80 tokens/s, Accepted: 84 tokens, Drafted: 98 tokens, Per-position acceptance rate: 0.878, 0.837, Avg Draft acceptance rate: 85.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:58644 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38342 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:02 [loggers.py:323] Engine 000: Avg prompt throughput: 1529.0 tokens/s, Avg generation throughput: 110.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 16.7%, MM cache hit rate: 93.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.35, Accepted throughput: 63.19 tokens/s, Drafted throughput: 93.59 tokens/s, Accepted: 632 tokens, Drafted: 936 tokens, Per-position acceptance rate: 0.778, 0.573, Avg Draft acceptance rate: 67.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:49568 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:12 [loggers.py:323] Engine 000: Avg prompt throughput: 8.5 tokens/s, Avg generation throughput: 126.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 16.7%, MM cache hit rate: 93.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.30, Accepted throughput: 71.59 tokens/s, Drafted throughput: 110.39 tokens/s, Accepted: 716 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.766, 0.531, Avg Draft acceptance rate: 64.9%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:53428 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:22 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 120.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 16.7%, MM cache hit rate: 93.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.16, Accepted throughput: 65.00 tokens/s, Drafted throughput: 111.59 tokens/s, Accepted: 650 tokens, Drafted: 1116 tokens, Per-position acceptance rate: 0.703, 0.462, Avg Draft acceptance rate: 58.2%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53214 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 78.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 40.0%, Prefix cache hit rate: 15.8%, MM cache hit rate: 93.1%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.02, Accepted throughput: 39.70 tokens/s, Drafted throughput: 77.60 tokens/s, Accepted: 397 tokens, Drafted: 776 tokens, Per-position acceptance rate: 0.631, 0.392, Avg Draft acceptance rate: 51.2%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 81.5%, Prefix cache hit rate: 15.8%, MM cache hit rate: 93.1%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59288 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:56286 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59294 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:59298 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:52 [loggers.py:323] Engine 000: Avg prompt throughput: 14129.1 tokens/s, Avg generation throughput: 88.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:31:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.40, Accepted throughput: 25.75 tokens/s, Drafted throughput: 36.80 tokens/s, Accepted: 515 tokens, Drafted: 736 tokens, Per-position acceptance rate: 0.788, 0.611, Avg Draft acceptance rate: 70.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:02 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 120.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.15, Accepted throughput: 64.30 tokens/s, Drafted throughput: 111.40 tokens/s, Accepted: 643 tokens, Drafted: 1114 tokens, Per-position acceptance rate: 0.713, 0.442, Avg Draft acceptance rate: 57.7%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:40376 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:12 [loggers.py:323] Engine 000: Avg prompt throughput: 8.7 tokens/s, Avg generation throughput: 129.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.35, Accepted throughput: 74.70 tokens/s, Drafted throughput: 110.40 tokens/s, Accepted: 747 tokens, Drafted: 1104 tokens, Per-position acceptance rate: 0.775, 0.578, Avg Draft acceptance rate: 67.7%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:51024 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54062 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:22 [loggers.py:323] Engine 000: Avg prompt throughput: 25.2 tokens/s, Avg generation throughput: 127.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.35, Accepted throughput: 73.19 tokens/s, Drafted throughput: 108.79 tokens/s, Accepted: 732 tokens, Drafted: 1088 tokens, Per-position acceptance rate: 0.774, 0.572, Avg Draft acceptance rate: 67.3%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54076 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:54078 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53562 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:32 [loggers.py:323] Engine 000: Avg prompt throughput: 38.1 tokens/s, Avg generation throughput: 133.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:32 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.48, Accepted throughput: 79.80 tokens/s, Drafted throughput: 107.80 tokens/s, Accepted: 798 tokens, Drafted: 1078 tokens, Per-position acceptance rate: 0.831, 0.649, Avg Draft acceptance rate: 74.0%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:42 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 128.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:42 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.32, Accepted throughput: 73.10 tokens/s, Drafted throughput: 110.60 tokens/s, Accepted: 731 tokens, Drafted: 1106 tokens, Per-position acceptance rate: 0.750, 0.571, Avg Draft acceptance rate: 66.1%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:36210 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:53576 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:52 [loggers.py:323] Engine 000: Avg prompt throughput: 13.4 tokens/s, Avg generation throughput: 131.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:32:52 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.42, Accepted throughput: 77.20 tokens/s, Drafted throughput: 109.00 tokens/s, Accepted: 772 tokens, Drafted: 1090 tokens, Per-position acceptance rate: 0.796, 0.620, Avg Draft acceptance rate: 70.8%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:38118 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47594 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47610 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47622 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:02 [loggers.py:323] Engine 000: Avg prompt throughput: 59.9 tokens/s, Avg generation throughput: 137.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:02 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.59, Accepted throughput: 84.40 tokens/s, Drafted throughput: 106.20 tokens/s, Accepted: 844 tokens, Drafted: 1062 tokens, Per-position acceptance rate: 0.868, 0.721, Avg Draft acceptance rate: 79.5%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47632 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:47648 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45364 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:12 [loggers.py:323] Engine 000: Avg prompt throughput: 27.9 tokens/s, Avg generation throughput: 142.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.5%, Prefix cache hit rate: 15.7%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:12 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.64, Accepted throughput: 88.50 tokens/s, Drafted throughput: 108.00 tokens/s, Accepted: 885 tokens, Drafted: 1080 tokens, Per-position acceptance rate: 0.891, 0.748, Avg Draft acceptance rate: 81.9%
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45372 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 172.21.0.1:45386 - "POST /v1/chat/completions HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47374 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:22 [loggers.py:323] Engine 000: Avg prompt throughput: 32.5 tokens/s, Avg generation throughput: 28.2 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 15.6%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:22 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.86, Accepted throughput: 18.40 tokens/s, Drafted throughput: 19.80 tokens/s, Accepted: 184 tokens, Drafted: 198 tokens, Per-position acceptance rate: 0.970, 0.889, Avg Draft acceptance rate: 92.9%
|
||||||
|
(APIServer pid=1) INFO 09-18 14:33:32 [loggers.py:323] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 15.6%, MM cache hit rate: 93.5%
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:51446 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:47488 - "GET /health HTTP/1.1" 200 OK
|
||||||
|
(APIServer pid=1) INFO: 127.0.0.1:50100 - "GET /health HTTP/1.1" 200 OK
|
||||||
File diff suppressed because one or more lines are too long
@@ -0,0 +1,46 @@
|
|||||||
|
name: qwen38-flash-rtx6000d
|
||||||
|
services:
|
||||||
|
vllm:
|
||||||
|
image: local/qwen38-flash-6000d:0bfc7a15
|
||||||
|
build: .
|
||||||
|
container_name: qwen38-flash-6000d
|
||||||
|
gpus: all
|
||||||
|
shm_size: 8g
|
||||||
|
mem_limit: 210g
|
||||||
|
memswap_limit: 210g
|
||||||
|
restart: "no"
|
||||||
|
ports:
|
||||||
|
- "${BIND_ADDRESS:-127.0.0.1}:${API_PORT:-8000}:8000"
|
||||||
|
environment:
|
||||||
|
HF_HUB_OFFLINE: "1"
|
||||||
|
VLLM_USE_V2_MODEL_RUNNER: "1"
|
||||||
|
VLLM_WORKER_MULTIPROC_METHOD: spawn
|
||||||
|
OMP_NUM_THREADS: "8"
|
||||||
|
TORCHINDUCTOR_COMPILE_THREADS: "2"
|
||||||
|
CUTE_DSL_ARCH: sm_120a
|
||||||
|
volumes:
|
||||||
|
- /data/flash-next/models/nvidia-Qwen3.8-Flash-Next-NVFP4:/model:ro
|
||||||
|
- /data/flash-next/cache:/root/.cache
|
||||||
|
- ./secrets/api-key:/run/secrets/api-key:ro
|
||||||
|
entrypoint: ["/bin/bash", "-lc"]
|
||||||
|
command:
|
||||||
|
- >-
|
||||||
|
exec vllm serve /model
|
||||||
|
--served-model-name qwen3.8-flash-next
|
||||||
|
--host 0.0.0.0 --port 8000
|
||||||
|
--tensor-parallel-size 1 --dtype bfloat16
|
||||||
|
--engram-config '{"cpu_offload":true}'
|
||||||
|
--kv-cache-dtype fp8 --gpu-memory-utilization 0.985
|
||||||
|
--max-model-len 131072 --max-num-seqs 1 --max-num-batched-tokens 2048
|
||||||
|
--enable-chunked-prefill --enable-prefix-caching
|
||||||
|
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
|
||||||
|
--compilation-config '{"mode":0,"cudagraph_mode":"FULL","cudagraph_capture_sizes":[1,3]}' --no-enable-flashinfer-autotune
|
||||||
|
--load-format safetensors
|
||||||
|
--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
|
||||||
|
--api-key "$$(cat /run/secrets/api-key)"
|
||||||
|
healthcheck:
|
||||||
|
test: ["CMD", "python3", "-c", "import urllib.request; urllib.request.urlopen('http://127.0.0.1:8000/health', timeout=5)"]
|
||||||
|
interval: 30s
|
||||||
|
timeout: 10s
|
||||||
|
retries: 5
|
||||||
|
start_period: 30m
|
||||||
@@ -0,0 +1 @@
|
|||||||
|
completed
|
||||||
@@ -0,0 +1,39 @@
|
|||||||
|
{
|
||||||
|
"paused_at": 1789702340.4511492,
|
||||||
|
"reason": "User requested pause before leaving work",
|
||||||
|
"baseline_requests": 92,
|
||||||
|
"baseline_failures": [],
|
||||||
|
"quality_finished": [
|
||||||
|
{
|
||||||
|
"name": "invoice-extraction",
|
||||||
|
"passed": true
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "deduplicate",
|
||||||
|
"passed": true
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "schedule",
|
||||||
|
"passed": true
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "chinese-policy",
|
||||||
|
"passed": true
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "merge-intervals",
|
||||||
|
"passed": false
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "binary-search",
|
||||||
|
"passed": true
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"name": "tool-arguments",
|
||||||
|
"passed": true
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"health": "healthy",
|
||||||
|
"mtp_active": false,
|
||||||
|
"remaining": "Finish interrupted baseline quality tasks, then run full MTP paired qualification. Do not auto-resume."
|
||||||
|
}
|
||||||
@@ -0,0 +1,636 @@
|
|||||||
|
{"time": 1789740819.2802572, "available_gib": 173.186279296875, "oom_kill": 0, "gpu": "80181, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789740821.3009336, "available_gib": 174.9003143310547, "oom_kill": 0, "gpu": "80181, 85651, 0, 46", "stop": false}
|
||||||
|
{"time": 1789740823.3213952, "available_gib": 175.68308639526367, "oom_kill": 0, "gpu": "80181, 85651, 0, 45", "stop": false}
|
||||||
|
{"time": 1789740825.3415186, "available_gib": 175.66448593139648, "oom_kill": 0, "gpu": "80181, 85651, 0, 45", "stop": false}
|
||||||
|
{"time": 1789740827.361917, "available_gib": 175.65348434448242, "oom_kill": 0, "gpu": "80181, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789740835.2971873, "available_gib": 179.34682846069336, "oom_kill": 0, "gpu": "3, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789740837.3220885, "available_gib": 242.46263122558594, "oom_kill": 0, "gpu": "0, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789740839.3450441, "available_gib": 242.38217163085938, "oom_kill": 0, "gpu": "0, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789740841.3693442, "available_gib": 242.3173484802246, "oom_kill": 0, "gpu": "0, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789740843.3943434, "available_gib": 242.2801742553711, "oom_kill": 0, "gpu": "0, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789740845.4192286, "available_gib": 242.26103973388672, "oom_kill": 0, "gpu": "0, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789740847.443701, "available_gib": 242.2067985534668, "oom_kill": 0, "gpu": "0, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789740849.4685829, "available_gib": 242.1376838684082, "oom_kill": 0, "gpu": "0, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789740851.4928648, "available_gib": 242.0900535583496, "oom_kill": 0, "gpu": "0, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789740853.5345619, "available_gib": 241.70652389526367, "oom_kill": 0, "gpu": "3, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789740855.5770147, "available_gib": 241.38035202026367, "oom_kill": 0, "gpu": "3, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789740857.6183977, "available_gib": 241.15746688842773, "oom_kill": 0, "gpu": "3, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740859.6609154, "available_gib": 240.8644142150879, "oom_kill": 0, "gpu": "3, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740861.703317, "available_gib": 240.31078720092773, "oom_kill": 0, "gpu": "3, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740863.7463453, "available_gib": 240.090576171875, "oom_kill": 0, "gpu": "3, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740865.7890768, "available_gib": 239.8240852355957, "oom_kill": 0, "gpu": "3, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740867.8104672, "available_gib": 239.2336769104004, "oom_kill": 0, "gpu": "2915, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740869.8305519, "available_gib": 237.92010116577148, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740871.8501878, "available_gib": 233.14883041381836, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740873.8720696, "available_gib": 228.9897918701172, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740875.8927617, "available_gib": 225.0773048400879, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740877.9129758, "available_gib": 221.16528701782227, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740879.9331362, "available_gib": 217.26790618896484, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740881.9531898, "available_gib": 213.3772735595703, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740883.9730153, "available_gib": 209.36343383789062, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740885.9928901, "available_gib": 205.359375, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740888.0129483, "available_gib": 201.37001419067383, "oom_kill": 0, "gpu": "4285, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740890.0330484, "available_gib": 197.37360000610352, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740892.0531528, "available_gib": 193.40413665771484, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740894.073616, "available_gib": 189.38990783691406, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740896.0942674, "available_gib": 185.35794830322266, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740898.1145465, "available_gib": 181.36968231201172, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740900.1347847, "available_gib": 177.37187957763672, "oom_kill": 0, "gpu": "4285, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740902.598213, "available_gib": 173.75665283203125, "oom_kill": 0, "gpu": "4291, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740904.6195498, "available_gib": 173.6540985107422, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740906.6409316, "available_gib": 173.69190979003906, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740908.662392, "available_gib": 173.71348190307617, "oom_kill": 0, "gpu": "76995, 85651, 6, 35", "stop": false}
|
||||||
|
{"time": 1789740910.683159, "available_gib": 173.75057983398438, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740912.7046502, "available_gib": 173.7825698852539, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740914.7260633, "available_gib": 173.80112075805664, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740916.747437, "available_gib": 173.84814834594727, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740918.768972, "available_gib": 173.8573341369629, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740920.7905774, "available_gib": 173.88520050048828, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740922.8122122, "available_gib": 173.93902587890625, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740924.8340595, "available_gib": 173.95701217651367, "oom_kill": 0, "gpu": "76995, 85651, 6, 35", "stop": false}
|
||||||
|
{"time": 1789740926.8556974, "available_gib": 173.98919677734375, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740928.8771217, "available_gib": 174.04013061523438, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740930.8984346, "available_gib": 174.06299591064453, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740932.9192665, "available_gib": 174.0987091064453, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740934.940642, "available_gib": 174.10751724243164, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740936.9654121, "available_gib": 174.12053298950195, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740938.9867702, "available_gib": 174.1371192932129, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740941.008168, "available_gib": 174.151123046875, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740943.029537, "available_gib": 174.1676788330078, "oom_kill": 0, "gpu": "76995, 85651, 4, 35", "stop": false}
|
||||||
|
{"time": 1789740945.0561945, "available_gib": 174.19272232055664, "oom_kill": 0, "gpu": "76995, 85651, 9, 35", "stop": false}
|
||||||
|
{"time": 1789740947.0763323, "available_gib": 173.99910736083984, "oom_kill": 0, "gpu": "82531, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740949.09636, "available_gib": 174.00670623779297, "oom_kill": 0, "gpu": "82531, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740951.1165512, "available_gib": 174.0402374267578, "oom_kill": 0, "gpu": "82559, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740953.1376595, "available_gib": 174.01544570922852, "oom_kill": 0, "gpu": "82613, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740955.158309, "available_gib": 173.81304550170898, "oom_kill": 0, "gpu": "79131, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740957.1781545, "available_gib": 173.56573104858398, "oom_kill": 0, "gpu": "79131, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740959.1984546, "available_gib": 173.17522048950195, "oom_kill": 0, "gpu": "81095, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740961.218363, "available_gib": 173.13940811157227, "oom_kill": 0, "gpu": "81095, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740963.2382004, "available_gib": 173.142822265625, "oom_kill": 0, "gpu": "81095, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740965.2591472, "available_gib": 173.2548713684082, "oom_kill": 0, "gpu": "82317, 85651, 100, 43", "stop": false}
|
||||||
|
{"time": 1789740967.2800572, "available_gib": 173.30116271972656, "oom_kill": 0, "gpu": "82317, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789740969.3007247, "available_gib": 173.33086776733398, "oom_kill": 0, "gpu": "82317, 85651, 100, 45", "stop": false}
|
||||||
|
{"time": 1789740971.3209436, "available_gib": 173.2718734741211, "oom_kill": 0, "gpu": "82319, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789740973.3411708, "available_gib": 173.2543830871582, "oom_kill": 0, "gpu": "82319, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789740975.3611605, "available_gib": 173.22941207885742, "oom_kill": 0, "gpu": "82319, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740977.3820965, "available_gib": 173.19965362548828, "oom_kill": 0, "gpu": "79465, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740979.4032042, "available_gib": 172.9642333984375, "oom_kill": 0, "gpu": "80553, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740981.4241402, "available_gib": 173.15837478637695, "oom_kill": 0, "gpu": "80239, 85651, 1, 36", "stop": false}
|
||||||
|
{"time": 1789740983.4453032, "available_gib": 173.34973526000977, "oom_kill": 0, "gpu": "80335, 85651, 1, 36", "stop": false}
|
||||||
|
{"time": 1789740985.465689, "available_gib": 173.34513473510742, "oom_kill": 0, "gpu": "83033, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740987.485593, "available_gib": 173.26250457763672, "oom_kill": 0, "gpu": "83033, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740989.5053294, "available_gib": 173.25432968139648, "oom_kill": 0, "gpu": "83033, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740991.5256433, "available_gib": 173.26681900024414, "oom_kill": 0, "gpu": "83033, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789740993.545984, "available_gib": 173.16712951660156, "oom_kill": 0, "gpu": "83041, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740995.5664136, "available_gib": 173.12018585205078, "oom_kill": 0, "gpu": "83041, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740997.5864937, "available_gib": 173.06475448608398, "oom_kill": 0, "gpu": "83041, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789740999.6068847, "available_gib": 173.06975173950195, "oom_kill": 0, "gpu": "83175, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789741001.6269546, "available_gib": 173.0239143371582, "oom_kill": 0, "gpu": "83175, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789741003.6464329, "available_gib": 173.03963088989258, "oom_kill": 0, "gpu": "83175, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789741005.6660495, "available_gib": 173.04325103759766, "oom_kill": 0, "gpu": "83175, 85651, 0, 35", "stop": false}
|
||||||
|
{"time": 1789741007.6909246, "available_gib": 173.03511810302734, "oom_kill": 0, "gpu": "83181, 85651, 97, 40", "stop": false}
|
||||||
|
{"time": 1789741009.7155397, "available_gib": 173.04791259765625, "oom_kill": 0, "gpu": "83181, 85651, 100, 42", "stop": false}
|
||||||
|
{"time": 1789741011.741975, "available_gib": 173.05370712280273, "oom_kill": 0, "gpu": "83181, 85651, 91, 43", "stop": false}
|
||||||
|
{"time": 1789741013.7702243, "available_gib": 173.06000518798828, "oom_kill": 0, "gpu": "83181, 85651, 100, 43", "stop": false}
|
||||||
|
{"time": 1789741015.7957313, "available_gib": 172.97036361694336, "oom_kill": 0, "gpu": "83853, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789741017.8195662, "available_gib": 172.3494644165039, "oom_kill": 0, "gpu": "84773, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789741019.8439367, "available_gib": 172.37882614135742, "oom_kill": 0, "gpu": "84775, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741021.8701403, "available_gib": 172.38854217529297, "oom_kill": 0, "gpu": "84777, 85651, 100, 45", "stop": false}
|
||||||
|
{"time": 1789741023.8952549, "available_gib": 172.38577270507812, "oom_kill": 0, "gpu": "84777, 85651, 100, 45", "stop": false}
|
||||||
|
{"time": 1789741025.9202504, "available_gib": 172.39564514160156, "oom_kill": 0, "gpu": "84777, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789741027.9458134, "available_gib": 172.4191017150879, "oom_kill": 0, "gpu": "84777, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789741029.9712784, "available_gib": 172.4500732421875, "oom_kill": 0, "gpu": "84777, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789741031.9956667, "available_gib": 172.44888305664062, "oom_kill": 0, "gpu": "84777, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789741034.0216715, "available_gib": 172.46278381347656, "oom_kill": 0, "gpu": "84777, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789741036.0466619, "available_gib": 172.4787483215332, "oom_kill": 0, "gpu": "84777, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789741038.0724404, "available_gib": 172.48638916015625, "oom_kill": 0, "gpu": "84777, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789741040.0974963, "available_gib": 172.48619079589844, "oom_kill": 0, "gpu": "84777, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789741042.122183, "available_gib": 172.48778915405273, "oom_kill": 0, "gpu": "84777, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789741044.147877, "available_gib": 172.4895133972168, "oom_kill": 0, "gpu": "84777, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789741046.1730351, "available_gib": 172.48453903198242, "oom_kill": 0, "gpu": "84777, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789741048.1978786, "available_gib": 172.48399353027344, "oom_kill": 0, "gpu": "84777, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789741050.2226956, "available_gib": 172.4863739013672, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741052.2472408, "available_gib": 172.48599243164062, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741054.2725835, "available_gib": 172.4872932434082, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741056.2980225, "available_gib": 172.48407745361328, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741058.323644, "available_gib": 172.4882583618164, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741060.3479798, "available_gib": 172.49619674682617, "oom_kill": 0, "gpu": "84777, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789741062.3741963, "available_gib": 172.49749755859375, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741064.4008222, "available_gib": 172.5046501159668, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741066.426815, "available_gib": 172.50188827514648, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741068.4523132, "available_gib": 172.49441146850586, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741070.4774675, "available_gib": 172.5206756591797, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741072.5031607, "available_gib": 172.52532196044922, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741074.5288324, "available_gib": 172.5246810913086, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741076.55463, "available_gib": 172.52860260009766, "oom_kill": 0, "gpu": "84777, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789741078.580394, "available_gib": 172.53252792358398, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741080.6059177, "available_gib": 172.52143096923828, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741082.631272, "available_gib": 172.5246353149414, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741084.6569903, "available_gib": 172.52610397338867, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741086.6820202, "available_gib": 172.52538681030273, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741088.707631, "available_gib": 172.52592086791992, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741090.7342474, "available_gib": 172.52952194213867, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741092.7602568, "available_gib": 172.51386260986328, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741094.7855926, "available_gib": 172.51448822021484, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741096.8111234, "available_gib": 172.53641891479492, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741098.8369813, "available_gib": 172.54050827026367, "oom_kill": 0, "gpu": "84777, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789741100.8614364, "available_gib": 172.5476303100586, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741102.886667, "available_gib": 172.55320739746094, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741104.9112227, "available_gib": 172.5581817626953, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741106.9371302, "available_gib": 172.5596046447754, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741108.9645028, "available_gib": 172.57370376586914, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741110.9901714, "available_gib": 172.5766143798828, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741113.0156636, "available_gib": 172.56248092651367, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741115.0409946, "available_gib": 172.56109619140625, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741117.0663059, "available_gib": 172.56178665161133, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741119.0918598, "available_gib": 172.56219100952148, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741121.1182446, "available_gib": 172.56241989135742, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741123.143585, "available_gib": 172.5666275024414, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741125.1687214, "available_gib": 172.5758934020996, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741127.1944346, "available_gib": 172.59615325927734, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741129.2197342, "available_gib": 172.59877014160156, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741131.246467, "available_gib": 172.59066009521484, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741133.2724533, "available_gib": 172.59540557861328, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741135.298332, "available_gib": 172.58774185180664, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741137.324065, "available_gib": 172.58942413330078, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741139.3505917, "available_gib": 172.5894317626953, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741141.3752382, "available_gib": 172.59441757202148, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741143.4012392, "available_gib": 172.58800506591797, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741145.42648, "available_gib": 172.58928680419922, "oom_kill": 0, "gpu": "84777, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789741147.4524264, "available_gib": 172.5924301147461, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741149.478515, "available_gib": 172.59656143188477, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741151.504395, "available_gib": 172.59680938720703, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741153.5305753, "available_gib": 172.59601211547852, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741155.5562935, "available_gib": 172.59218215942383, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741157.5822582, "available_gib": 172.59374237060547, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741159.608319, "available_gib": 172.59445190429688, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741161.6338634, "available_gib": 172.59900665283203, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741163.6602354, "available_gib": 172.5950813293457, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741165.6856523, "available_gib": 172.59679412841797, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741167.712001, "available_gib": 172.59453964233398, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741169.7376652, "available_gib": 172.5972023010254, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741171.7649684, "available_gib": 172.59901809692383, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741173.7906501, "available_gib": 172.59768295288086, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741175.8160305, "available_gib": 172.59435272216797, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741177.8417437, "available_gib": 172.5922622680664, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741179.8673508, "available_gib": 172.59277725219727, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741181.893409, "available_gib": 172.59664916992188, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741183.9197965, "available_gib": 172.59469604492188, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741185.9461718, "available_gib": 172.6025619506836, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741187.9732041, "available_gib": 172.6000099182129, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741189.9989462, "available_gib": 172.5972671508789, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741192.0250013, "available_gib": 172.59841918945312, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741194.0514863, "available_gib": 172.59895706176758, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741196.078451, "available_gib": 172.59823608398438, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741198.1044512, "available_gib": 172.5980682373047, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741200.1301706, "available_gib": 172.59436798095703, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741202.1558104, "available_gib": 172.5906639099121, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741204.1816776, "available_gib": 172.58790969848633, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741206.207368, "available_gib": 172.58660888671875, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741208.2329898, "available_gib": 172.59147262573242, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741210.2592282, "available_gib": 172.58969497680664, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741212.2855017, "available_gib": 172.58600997924805, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741214.3117945, "available_gib": 172.58898544311523, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741216.3374472, "available_gib": 172.58516693115234, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741218.363442, "available_gib": 172.5889015197754, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741220.3893785, "available_gib": 172.5942268371582, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741222.4151676, "available_gib": 172.59383010864258, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741224.4407148, "available_gib": 172.59273147583008, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741226.4665043, "available_gib": 172.59019088745117, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741228.4924395, "available_gib": 172.58746719360352, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741230.518861, "available_gib": 172.58978271484375, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741232.5449567, "available_gib": 172.59271621704102, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741234.5708766, "available_gib": 172.59061813354492, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741236.5977776, "available_gib": 172.59440994262695, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741238.623592, "available_gib": 172.59325408935547, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741240.6492276, "available_gib": 172.59133911132812, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741242.675038, "available_gib": 172.5888328552246, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741244.7013226, "available_gib": 172.5844383239746, "oom_kill": 0, "gpu": "84777, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789741246.7269475, "available_gib": 172.58657836914062, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741248.753087, "available_gib": 172.5858383178711, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741250.7786634, "available_gib": 172.58650588989258, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741252.8044834, "available_gib": 172.6007308959961, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741254.8309152, "available_gib": 172.5912971496582, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741256.8571315, "available_gib": 172.59735107421875, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741258.8827105, "available_gib": 172.60196685791016, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741260.9088016, "available_gib": 172.6006965637207, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741262.9342268, "available_gib": 172.59653091430664, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741264.9607158, "available_gib": 172.59452438354492, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741266.9865706, "available_gib": 172.59494400024414, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741269.0125685, "available_gib": 172.5970001220703, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741271.0387127, "available_gib": 172.59401321411133, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741273.064668, "available_gib": 172.59226989746094, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741275.0901368, "available_gib": 172.59353256225586, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741277.1163597, "available_gib": 172.60289764404297, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741279.1419446, "available_gib": 172.60644912719727, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741281.1669106, "available_gib": 172.59186553955078, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741283.1926455, "available_gib": 172.5934066772461, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741285.2179687, "available_gib": 172.5938835144043, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741287.2435546, "available_gib": 172.59416961669922, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741289.2693803, "available_gib": 172.59252166748047, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741291.2946339, "available_gib": 172.59198379516602, "oom_kill": 0, "gpu": "84777, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789741293.3176959, "available_gib": 172.45270919799805, "oom_kill": 0, "gpu": "84777, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741295.3416948, "available_gib": 172.4500389099121, "oom_kill": 0, "gpu": "84777, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741297.3657167, "available_gib": 172.4520263671875, "oom_kill": 0, "gpu": "84777, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741299.391012, "available_gib": 172.4562873840332, "oom_kill": 0, "gpu": "84777, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741301.4155679, "available_gib": 172.44854354858398, "oom_kill": 0, "gpu": "84777, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741303.440696, "available_gib": 172.45803833007812, "oom_kill": 0, "gpu": "84777, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741305.4639714, "available_gib": 172.4685401916504, "oom_kill": 0, "gpu": "84777, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741307.4892244, "available_gib": 172.47570037841797, "oom_kill": 0, "gpu": "84777, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741309.5142539, "available_gib": 172.46459197998047, "oom_kill": 0, "gpu": "84777, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741311.5401502, "available_gib": 172.46273803710938, "oom_kill": 0, "gpu": "84777, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741313.564871, "available_gib": 172.45700073242188, "oom_kill": 0, "gpu": "84777, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741315.5890977, "available_gib": 172.4610252380371, "oom_kill": 0, "gpu": "84777, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741317.6139405, "available_gib": 172.46249389648438, "oom_kill": 0, "gpu": "84777, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741319.6383853, "available_gib": 172.4628562927246, "oom_kill": 0, "gpu": "84777, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741321.6626294, "available_gib": 172.4601593017578, "oom_kill": 0, "gpu": "84777, 85651, 100, 64", "stop": false}
|
||||||
|
{"time": 1789741323.6870399, "available_gib": 172.45955657958984, "oom_kill": 0, "gpu": "84777, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741325.7122967, "available_gib": 172.4614601135254, "oom_kill": 0, "gpu": "84797, 85651, 96, 59", "stop": false}
|
||||||
|
{"time": 1789741327.7368903, "available_gib": 172.46478652954102, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741329.7635977, "available_gib": 172.46117401123047, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741331.7883792, "available_gib": 172.1952018737793, "oom_kill": 0, "gpu": "84797, 85651, 31, 58", "stop": false}
|
||||||
|
{"time": 1789741333.814668, "available_gib": 172.46908569335938, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741335.840979, "available_gib": 172.46453857421875, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741337.8665805, "available_gib": 172.46465301513672, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741339.892834, "available_gib": 172.4676513671875, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741341.9185119, "available_gib": 172.45960998535156, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741343.9446836, "available_gib": 172.45569610595703, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741345.9706972, "available_gib": 172.46644592285156, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741347.9966786, "available_gib": 172.47346878051758, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741350.0219789, "available_gib": 172.47612762451172, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741352.047552, "available_gib": 172.48035430908203, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741354.074702, "available_gib": 172.47237014770508, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741356.1006968, "available_gib": 172.48662185668945, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741358.1273825, "available_gib": 172.49077224731445, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741360.153606, "available_gib": 172.49484634399414, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741362.1808174, "available_gib": 172.49349212646484, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741364.2074633, "available_gib": 172.48525619506836, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741366.2316606, "available_gib": 172.46701049804688, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741368.2557063, "available_gib": 172.45177841186523, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741370.2806962, "available_gib": 172.4515037536621, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741372.304079, "available_gib": 172.48371124267578, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741374.3290725, "available_gib": 172.49667739868164, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741376.3535948, "available_gib": 172.50416946411133, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741378.3773885, "available_gib": 172.50660705566406, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741380.4043179, "available_gib": 172.49861907958984, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741382.430186, "available_gib": 172.50277709960938, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741384.4583824, "available_gib": 172.50247192382812, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741386.4841335, "available_gib": 172.4947280883789, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741388.5096605, "available_gib": 172.49786758422852, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741390.5359368, "available_gib": 172.48962020874023, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741392.5616343, "available_gib": 172.49933242797852, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741394.5877106, "available_gib": 172.49702072143555, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741396.6137774, "available_gib": 172.48300170898438, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741398.6387274, "available_gib": 172.4930419921875, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741400.6645753, "available_gib": 172.4931526184082, "oom_kill": 0, "gpu": "84797, 85651, 99, 56", "stop": false}
|
||||||
|
{"time": 1789741402.6902084, "available_gib": 172.49462127685547, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741404.7151074, "available_gib": 172.48286819458008, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741406.741119, "available_gib": 172.4792022705078, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741408.7673216, "available_gib": 172.4764404296875, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741410.7931156, "available_gib": 172.47342681884766, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741412.8182945, "available_gib": 172.47457885742188, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741414.843522, "available_gib": 172.47514724731445, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741416.868963, "available_gib": 172.47369384765625, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741418.8937824, "available_gib": 172.47310638427734, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741420.9201572, "available_gib": 172.48359298706055, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741422.945354, "available_gib": 172.47949600219727, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741424.9705348, "available_gib": 172.47273635864258, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741426.994891, "available_gib": 172.47621536254883, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741429.0192063, "available_gib": 172.47613143920898, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741431.0440989, "available_gib": 172.46807098388672, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741433.0688696, "available_gib": 172.4662971496582, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741435.0925848, "available_gib": 172.4659652709961, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741437.1176612, "available_gib": 172.46691513061523, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741439.1432917, "available_gib": 172.45867919921875, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741441.169153, "available_gib": 172.46213912963867, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741443.1956718, "available_gib": 172.46083068847656, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741445.2216692, "available_gib": 172.46649551391602, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741447.2482939, "available_gib": 172.47254180908203, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741449.2739253, "available_gib": 172.46931076049805, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741451.2997217, "available_gib": 172.4801368713379, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741453.325421, "available_gib": 172.47692108154297, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741455.352021, "available_gib": 172.46895217895508, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741457.3784454, "available_gib": 172.48260116577148, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741459.4047852, "available_gib": 172.4884490966797, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741461.4312932, "available_gib": 172.4850845336914, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741463.456794, "available_gib": 172.47660446166992, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741465.4824955, "available_gib": 172.47486877441406, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741467.5086417, "available_gib": 172.48181915283203, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741469.534954, "available_gib": 172.48472595214844, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741471.561733, "available_gib": 172.48307037353516, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741473.585763, "available_gib": 172.48308563232422, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741475.6101313, "available_gib": 172.48397064208984, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741477.6342216, "available_gib": 172.4755630493164, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741479.658697, "available_gib": 172.4962501525879, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741481.6836107, "available_gib": 172.50433349609375, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741483.7082045, "available_gib": 172.5045928955078, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741485.733786, "available_gib": 172.51230239868164, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741487.762203, "available_gib": 172.51962280273438, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741489.7879505, "available_gib": 172.51746368408203, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741491.813457, "available_gib": 172.51690292358398, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741493.8389447, "available_gib": 172.52256774902344, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741495.8650203, "available_gib": 172.5188980102539, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741497.890935, "available_gib": 172.51535034179688, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741499.9178364, "available_gib": 172.51886367797852, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741501.9440494, "available_gib": 172.51777267456055, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741503.970157, "available_gib": 172.51541900634766, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741505.995976, "available_gib": 172.5113296508789, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741508.0218227, "available_gib": 172.51268768310547, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741510.0484116, "available_gib": 172.51382446289062, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741512.0743947, "available_gib": 172.51168060302734, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741514.100623, "available_gib": 172.51412963867188, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741516.1266322, "available_gib": 172.50981521606445, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741518.1520777, "available_gib": 172.50579452514648, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741520.177705, "available_gib": 172.5135269165039, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741522.2018483, "available_gib": 172.50432968139648, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741524.2257843, "available_gib": 172.49609375, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741526.250069, "available_gib": 172.49253463745117, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741528.274081, "available_gib": 172.49193572998047, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741530.3013144, "available_gib": 172.49456787109375, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741532.3256724, "available_gib": 172.49900817871094, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741534.3504145, "available_gib": 172.49559783935547, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741536.3775592, "available_gib": 172.49813079833984, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741538.4026291, "available_gib": 172.51340103149414, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741540.428612, "available_gib": 172.51261520385742, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741542.4542751, "available_gib": 172.50437927246094, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741544.4801457, "available_gib": 172.50119018554688, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741546.5057626, "available_gib": 172.49696731567383, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741548.5312207, "available_gib": 172.4950714111328, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741550.5562596, "available_gib": 172.49409866333008, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741552.5814886, "available_gib": 172.50141525268555, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741554.60732, "available_gib": 172.49386596679688, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741556.633181, "available_gib": 172.49797821044922, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741558.6586742, "available_gib": 172.4902229309082, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741560.6842983, "available_gib": 172.50030899047852, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741562.709981, "available_gib": 172.50820922851562, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741564.735795, "available_gib": 172.49857330322266, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741566.761936, "available_gib": 172.50472259521484, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741568.7875214, "available_gib": 172.5027198791504, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741570.8133771, "available_gib": 172.5012969970703, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741572.8376153, "available_gib": 172.49773406982422, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741574.8626306, "available_gib": 172.49293899536133, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741576.8867316, "available_gib": 172.4933853149414, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741578.912077, "available_gib": 172.48458099365234, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741580.9366288, "available_gib": 172.48932266235352, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741582.9631386, "available_gib": 172.48468399047852, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741584.988347, "available_gib": 172.48320388793945, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741587.014133, "available_gib": 172.48634719848633, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741589.0350552, "available_gib": 171.95434188842773, "oom_kill": 0, "gpu": "84797, 85651, 39, 56", "stop": false}
|
||||||
|
{"time": 1789741591.0607831, "available_gib": 172.4834861755371, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741593.086687, "available_gib": 172.48233032226562, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741595.1124644, "available_gib": 172.4792022705078, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741597.139016, "available_gib": 172.47639846801758, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741599.1645033, "available_gib": 172.48011016845703, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741601.190295, "available_gib": 172.48334121704102, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741603.2152278, "available_gib": 172.47988891601562, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741605.2401967, "available_gib": 172.4741668701172, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741607.2656555, "available_gib": 172.47623825073242, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741609.2915845, "available_gib": 172.47593307495117, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741611.317451, "available_gib": 172.4743995666504, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741613.3426635, "available_gib": 172.47119522094727, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741615.3677783, "available_gib": 172.47011947631836, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741617.3928335, "available_gib": 172.47122955322266, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741619.418318, "available_gib": 172.47003555297852, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741621.4435518, "available_gib": 172.47172927856445, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741623.4685457, "available_gib": 172.47503662109375, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741625.4941125, "available_gib": 172.47409439086914, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741627.5185149, "available_gib": 172.47156524658203, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741629.5429614, "available_gib": 172.46810150146484, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741631.566678, "available_gib": 172.46736907958984, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741633.5915105, "available_gib": 172.47114944458008, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741635.615819, "available_gib": 172.46762466430664, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741637.6416702, "available_gib": 172.4699821472168, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741639.666648, "available_gib": 172.46722030639648, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741641.69122, "available_gib": 172.46813201904297, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741643.715641, "available_gib": 172.48611450195312, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741645.7411408, "available_gib": 172.47868728637695, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741647.766971, "available_gib": 172.4920310974121, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741649.7926688, "available_gib": 172.51209259033203, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741651.8183184, "available_gib": 172.5028953552246, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741653.8445783, "available_gib": 172.50262832641602, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741655.8702548, "available_gib": 172.5012550354004, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741657.896563, "available_gib": 172.49984741210938, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741659.9225292, "available_gib": 172.49716567993164, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741661.948111, "available_gib": 172.4964714050293, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741663.9738402, "available_gib": 172.49373626708984, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741666.0002856, "available_gib": 172.4827766418457, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741668.026015, "available_gib": 172.48533248901367, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741670.0512257, "available_gib": 172.46844482421875, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741672.076035, "available_gib": 172.45299911499023, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741674.102082, "available_gib": 172.44223403930664, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741676.1265807, "available_gib": 172.44892501831055, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741678.1521974, "available_gib": 172.45606994628906, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741680.1763911, "available_gib": 172.45378875732422, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741682.2012382, "available_gib": 172.45973205566406, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741684.2254128, "available_gib": 172.46291732788086, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741686.2500622, "available_gib": 172.46459197998047, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741688.2754319, "available_gib": 172.46313095092773, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741690.2998893, "available_gib": 172.47246170043945, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741692.3238094, "available_gib": 172.4721908569336, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741694.34924, "available_gib": 172.47052764892578, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741696.3737235, "available_gib": 172.48983001708984, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741698.399575, "available_gib": 172.48913192749023, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741700.4252586, "available_gib": 172.50072860717773, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741702.4510915, "available_gib": 172.49365997314453, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741704.476676, "available_gib": 172.4910011291504, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741706.5025585, "available_gib": 172.4918975830078, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741708.528735, "available_gib": 172.4951400756836, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741710.5560937, "available_gib": 172.49352645874023, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741712.582361, "available_gib": 172.49297714233398, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741714.607925, "available_gib": 172.49047470092773, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741716.6333158, "available_gib": 172.4922981262207, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741718.6594987, "available_gib": 172.48981857299805, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741720.6855524, "available_gib": 172.4907341003418, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741722.7115724, "available_gib": 172.48784637451172, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741724.7372165, "available_gib": 172.48683166503906, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741726.7630925, "available_gib": 172.48186492919922, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741728.7886727, "available_gib": 172.47835540771484, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741730.8119469, "available_gib": 172.47625350952148, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741732.8387287, "available_gib": 172.4801788330078, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741734.8636448, "available_gib": 172.4793472290039, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741736.8882198, "available_gib": 172.47815322875977, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741738.91259, "available_gib": 172.47755813598633, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741740.9376972, "available_gib": 172.4886245727539, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741742.9642003, "available_gib": 172.49336624145508, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741744.9904983, "available_gib": 172.49280166625977, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741747.0156195, "available_gib": 172.49225997924805, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741749.040796, "available_gib": 172.49156951904297, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741751.066529, "available_gib": 172.48834609985352, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741753.0923345, "available_gib": 172.49574279785156, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741755.1187913, "available_gib": 172.501708984375, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741757.1449804, "available_gib": 172.49158096313477, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741759.1705863, "available_gib": 172.4967918395996, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741761.1958637, "available_gib": 172.48858642578125, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741763.2221138, "available_gib": 172.5005226135254, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741765.2482564, "available_gib": 172.50199127197266, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741767.2743025, "available_gib": 172.49832153320312, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741769.300011, "available_gib": 172.49658203125, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741771.3254404, "available_gib": 172.49291229248047, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741773.3511305, "available_gib": 172.49331665039062, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741775.3765852, "available_gib": 172.49514389038086, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741777.4029198, "available_gib": 172.49507904052734, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741779.4280436, "available_gib": 172.4949836730957, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741781.4540715, "available_gib": 172.4795379638672, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741783.4800026, "available_gib": 172.49517822265625, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741785.5053408, "available_gib": 172.49518585205078, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741787.5296319, "available_gib": 172.4913444519043, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741789.5543952, "available_gib": 172.4939079284668, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741791.578663, "available_gib": 172.47870254516602, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741793.6034508, "available_gib": 172.4861068725586, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741795.6275413, "available_gib": 172.48805618286133, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741797.652829, "available_gib": 172.4846076965332, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741799.6786985, "available_gib": 172.48890686035156, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741801.7042093, "available_gib": 172.47224044799805, "oom_kill": 0, "gpu": "84797, 85651, 100, 59", "stop": false}
|
||||||
|
{"time": 1789741803.7302446, "available_gib": 172.5096092224121, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741805.7561207, "available_gib": 172.5116958618164, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741807.781601, "available_gib": 172.51754760742188, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741809.80762, "available_gib": 172.51726150512695, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741811.8336103, "available_gib": 172.51578903198242, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741813.8587685, "available_gib": 172.5129737854004, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741815.884552, "available_gib": 172.50617599487305, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741817.9097657, "available_gib": 172.50614547729492, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741819.935287, "available_gib": 172.49047088623047, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741821.9610224, "available_gib": 172.47478866577148, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741823.9864788, "available_gib": 172.48273086547852, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741826.0131614, "available_gib": 172.4861946105957, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741828.0385392, "available_gib": 172.50058364868164, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741830.0643904, "available_gib": 172.49138641357422, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741832.0902653, "available_gib": 172.49757385253906, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741834.1153727, "available_gib": 172.50112533569336, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741836.1410108, "available_gib": 172.4974708557129, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741838.1649923, "available_gib": 172.500732421875, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741840.189464, "available_gib": 172.48459243774414, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741842.2132912, "available_gib": 172.4875946044922, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741844.2369463, "available_gib": 172.48626327514648, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741846.2614973, "available_gib": 172.48511505126953, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741848.2858605, "available_gib": 172.48809051513672, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741850.3106422, "available_gib": 172.48698806762695, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741852.3353305, "available_gib": 172.48847198486328, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741854.359919, "available_gib": 172.49182891845703, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741856.3854227, "available_gib": 172.49138641357422, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741858.4105597, "available_gib": 172.49412536621094, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741860.4364076, "available_gib": 172.4915657043457, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741862.4614935, "available_gib": 172.494140625, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741864.4872365, "available_gib": 172.49219512939453, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741866.513035, "available_gib": 172.48833084106445, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741868.5387952, "available_gib": 172.48852157592773, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741870.5640156, "available_gib": 172.48776626586914, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741872.5893993, "available_gib": 172.48829650878906, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741874.6143098, "available_gib": 172.48689651489258, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741876.6393867, "available_gib": 172.48365783691406, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741878.6650698, "available_gib": 172.48781967163086, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741880.69113, "available_gib": 172.49098205566406, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741882.716942, "available_gib": 172.48964309692383, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741884.7425077, "available_gib": 172.4818878173828, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741886.7682352, "available_gib": 172.4808235168457, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741888.794801, "available_gib": 172.4782485961914, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741890.8179688, "available_gib": 172.45874404907227, "oom_kill": 0, "gpu": "84797, 85651, 100, 61", "stop": false}
|
||||||
|
{"time": 1789741892.8420055, "available_gib": 172.4709930419922, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741894.8656194, "available_gib": 172.4714126586914, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741896.8899474, "available_gib": 172.4563865661621, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741898.9144373, "available_gib": 172.45833206176758, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741900.939818, "available_gib": 172.46145248413086, "oom_kill": 0, "gpu": "84797, 85651, 100, 62", "stop": false}
|
||||||
|
{"time": 1789741902.9642656, "available_gib": 172.46326065063477, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741904.9893064, "available_gib": 172.46182250976562, "oom_kill": 0, "gpu": "84797, 85651, 100, 60", "stop": false}
|
||||||
|
{"time": 1789741907.0135221, "available_gib": 172.47748184204102, "oom_kill": 0, "gpu": "84797, 85651, 100, 63", "stop": false}
|
||||||
|
{"time": 1789741909.0396316, "available_gib": 172.48246383666992, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741911.0650105, "available_gib": 172.5012092590332, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741913.0910754, "available_gib": 172.4869384765625, "oom_kill": 0, "gpu": "84797, 85651, 100, 58", "stop": false}
|
||||||
|
{"time": 1789741915.117403, "available_gib": 172.48875427246094, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741917.1427345, "available_gib": 172.49105834960938, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741919.1681163, "available_gib": 172.48901748657227, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741921.1940665, "available_gib": 172.4850616455078, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741923.2193081, "available_gib": 172.4879264831543, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741925.2449188, "available_gib": 172.4845085144043, "oom_kill": 0, "gpu": "84797, 85651, 100, 57", "stop": false}
|
||||||
|
{"time": 1789741927.2707694, "available_gib": 172.4897575378418, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741929.2965708, "available_gib": 172.4865837097168, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741931.322507, "available_gib": 172.48991775512695, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741933.3481214, "available_gib": 172.4879913330078, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741935.3737943, "available_gib": 172.4864501953125, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741937.4018652, "available_gib": 172.47735595703125, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741939.4272096, "available_gib": 172.48353958129883, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741941.453043, "available_gib": 172.48789978027344, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741943.4784584, "available_gib": 172.48556900024414, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741945.5042894, "available_gib": 172.48368072509766, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741947.5304513, "available_gib": 172.47975540161133, "oom_kill": 0, "gpu": "84797, 85651, 83, 56", "stop": false}
|
||||||
|
{"time": 1789741949.5554903, "available_gib": 172.4870147705078, "oom_kill": 0, "gpu": "84797, 85651, 100, 56", "stop": false}
|
||||||
|
{"time": 1789741951.5813496, "available_gib": 172.48540496826172, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741953.6065516, "available_gib": 172.48471450805664, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741955.6324534, "available_gib": 172.4824333190918, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741957.6579292, "available_gib": 172.48537063598633, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741959.6830695, "available_gib": 172.4837532043457, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741961.7091649, "available_gib": 172.48063278198242, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741963.7350852, "available_gib": 172.48299407958984, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741965.7604392, "available_gib": 172.4800796508789, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741967.7854514, "available_gib": 172.47246170043945, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741969.8109448, "available_gib": 172.47763061523438, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741971.8365545, "available_gib": 172.47407150268555, "oom_kill": 0, "gpu": "84797, 85651, 87, 55", "stop": false}
|
||||||
|
{"time": 1789741973.8617017, "available_gib": 172.47308349609375, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741975.8863857, "available_gib": 172.47032165527344, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741977.9115927, "available_gib": 172.4730224609375, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741979.9368134, "available_gib": 172.47371292114258, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741981.963096, "available_gib": 172.46963500976562, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741983.9893205, "available_gib": 172.47371292114258, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741986.0154657, "available_gib": 172.47172927856445, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741988.0416458, "available_gib": 172.47505569458008, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741990.066806, "available_gib": 172.47400283813477, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741992.0920467, "available_gib": 172.4678840637207, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741994.1177907, "available_gib": 172.46394729614258, "oom_kill": 0, "gpu": "84797, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789741996.13816, "available_gib": 172.4609375, "oom_kill": 0, "gpu": "84797, 85651, 0, 49", "stop": false}
|
||||||
|
{"time": 1789741998.1577864, "available_gib": 172.4593391418457, "oom_kill": 0, "gpu": "84797, 85651, 0, 48", "stop": false}
|
||||||
|
{"time": 1789742000.1777647, "available_gib": 172.4475212097168, "oom_kill": 0, "gpu": "84797, 85651, 0, 48", "stop": false}
|
||||||
|
{"time": 1789742002.197598, "available_gib": 172.45057678222656, "oom_kill": 0, "gpu": "84797, 85651, 0, 47", "stop": false}
|
||||||
|
{"time": 1789742004.2174683, "available_gib": 172.45798873901367, "oom_kill": 0, "gpu": "84797, 85651, 0, 46", "stop": false}
|
||||||
|
{"time": 1789742006.237424, "available_gib": 172.45698928833008, "oom_kill": 0, "gpu": "84797, 85651, 0, 46", "stop": false}
|
||||||
|
{"time": 1789742008.2574737, "available_gib": 172.45877838134766, "oom_kill": 0, "gpu": "84797, 85651, 0, 45", "stop": false}
|
||||||
|
{"time": 1789742010.2774992, "available_gib": 172.46526336669922, "oom_kill": 0, "gpu": "84797, 85651, 0, 45", "stop": false}
|
||||||
|
{"time": 1789742012.297468, "available_gib": 172.463623046875, "oom_kill": 0, "gpu": "84797, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789742014.3176281, "available_gib": 172.46093368530273, "oom_kill": 0, "gpu": "84797, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789742016.3376563, "available_gib": 172.46144104003906, "oom_kill": 0, "gpu": "84797, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789742018.3576665, "available_gib": 172.46362686157227, "oom_kill": 0, "gpu": "84797, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789742020.3775542, "available_gib": 172.45814895629883, "oom_kill": 0, "gpu": "84797, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789742022.3975294, "available_gib": 172.45451736450195, "oom_kill": 0, "gpu": "84797, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789742024.4174948, "available_gib": 172.45882034301758, "oom_kill": 0, "gpu": "84797, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789742026.4376714, "available_gib": 172.45464706420898, "oom_kill": 0, "gpu": "84797, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789742028.4577258, "available_gib": 172.46048736572266, "oom_kill": 0, "gpu": "84797, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789742030.4775898, "available_gib": 172.45904541015625, "oom_kill": 0, "gpu": "84797, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789742032.497562, "available_gib": 172.4550666809082, "oom_kill": 0, "gpu": "84797, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789742034.5174677, "available_gib": 172.45556259155273, "oom_kill": 0, "gpu": "84797, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789742036.53738, "available_gib": 172.45584106445312, "oom_kill": 0, "gpu": "84797, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789742038.557099, "available_gib": 172.45731353759766, "oom_kill": 0, "gpu": "84797, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789742040.577116, "available_gib": 172.4537811279297, "oom_kill": 0, "gpu": "84797, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789742042.5970526, "available_gib": 172.45328903198242, "oom_kill": 0, "gpu": "84797, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789742044.6172743, "available_gib": 172.4581756591797, "oom_kill": 0, "gpu": "84797, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789742046.636964, "available_gib": 172.45625686645508, "oom_kill": 0, "gpu": "84797, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789742048.657087, "available_gib": 172.45297241210938, "oom_kill": 0, "gpu": "84797, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789742050.6770878, "available_gib": 172.45637893676758, "oom_kill": 0, "gpu": "84797, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789742052.6970072, "available_gib": 172.45327758789062, "oom_kill": 0, "gpu": "84797, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789742054.7170405, "available_gib": 172.45054626464844, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742056.7368138, "available_gib": 172.44028854370117, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742058.7569644, "available_gib": 172.4545555114746, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742060.7770686, "available_gib": 172.45268630981445, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742062.7970862, "available_gib": 172.44879531860352, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742064.8170195, "available_gib": 172.45532608032227, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742066.8367136, "available_gib": 172.46355819702148, "oom_kill": 0, "gpu": "84797, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789742068.856513, "available_gib": 172.44764709472656, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742070.8764846, "available_gib": 172.44832611083984, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742072.8963869, "available_gib": 172.44911575317383, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742074.916508, "available_gib": 172.4524688720703, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742076.9365323, "available_gib": 172.46300888061523, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742078.9565182, "available_gib": 172.4612922668457, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742080.976419, "available_gib": 172.46993255615234, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742082.996401, "available_gib": 172.4705810546875, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742085.0165048, "available_gib": 172.47637557983398, "oom_kill": 0, "gpu": "84797, 85651, 0, 37", "stop": false}
|
||||||
|
{"time": 1789742087.0367668, "available_gib": 172.47501373291016, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742089.056848, "available_gib": 172.48048782348633, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742091.0764582, "available_gib": 172.4441032409668, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742093.0963168, "available_gib": 172.44462203979492, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742095.1163652, "available_gib": 172.42941665649414, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742097.1367784, "available_gib": 172.4368019104004, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742099.1569095, "available_gib": 172.4488639831543, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742101.177585, "available_gib": 172.44111251831055, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742103.1983476, "available_gib": 172.46218490600586, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742105.2187157, "available_gib": 172.4701690673828, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742107.2389972, "available_gib": 172.47769165039062, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742109.259399, "available_gib": 172.4824333190918, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
|
{"time": 1789742111.2796185, "available_gib": 172.48604202270508, "oom_kill": 0, "gpu": "84797, 85651, 0, 36", "stop": false}
|
||||||
@@ -0,0 +1,669 @@
|
|||||||
|
{"time": 1789700981.085236, "available_gib": 173.2566680908203, "oom_kill": 0, "gpu": "80181, 85651, 0, 31", "stop": false}
|
||||||
|
{"time": 1789700983.1052513, "available_gib": 173.28267669677734, "oom_kill": 0, "gpu": "80181, 85651, 0, 31", "stop": false}
|
||||||
|
{"time": 1789700985.1252472, "available_gib": 173.27833938598633, "oom_kill": 0, "gpu": "80181, 85651, 0, 31", "stop": false}
|
||||||
|
{"time": 1789700987.1453247, "available_gib": 173.27637481689453, "oom_kill": 0, "gpu": "80181, 85651, 0, 31", "stop": false}
|
||||||
|
{"time": 1789700989.1653335, "available_gib": 173.25898361206055, "oom_kill": 0, "gpu": "80181, 85651, 0, 31", "stop": false}
|
||||||
|
{"time": 1789700991.191148, "available_gib": 173.27062606811523, "oom_kill": 0, "gpu": "80181, 85651, 90, 36", "stop": false}
|
||||||
|
{"time": 1789700993.2167222, "available_gib": 173.2563362121582, "oom_kill": 0, "gpu": "80181, 85651, 100, 38", "stop": false}
|
||||||
|
{"time": 1789700995.2421246, "available_gib": 173.25791931152344, "oom_kill": 0, "gpu": "80181, 85651, 100, 39", "stop": false}
|
||||||
|
{"time": 1789700997.2670276, "available_gib": 173.24958038330078, "oom_kill": 0, "gpu": "80181, 85651, 100, 39", "stop": false}
|
||||||
|
{"time": 1789700999.2924953, "available_gib": 173.2362518310547, "oom_kill": 0, "gpu": "80181, 85651, 100, 40", "stop": false}
|
||||||
|
{"time": 1789701001.317451, "available_gib": 173.24814224243164, "oom_kill": 0, "gpu": "80181, 85651, 100, 40", "stop": false}
|
||||||
|
{"time": 1789701003.338637, "available_gib": 173.13149642944336, "oom_kill": 0, "gpu": "80637, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789701005.36374, "available_gib": 173.09980392456055, "oom_kill": 0, "gpu": "80637, 85651, 100, 42", "stop": false}
|
||||||
|
{"time": 1789701007.3896658, "available_gib": 172.42918395996094, "oom_kill": 0, "gpu": "82221, 85651, 100, 45", "stop": false}
|
||||||
|
{"time": 1789701009.414385, "available_gib": 172.45566177368164, "oom_kill": 0, "gpu": "82221, 85651, 100, 43", "stop": false}
|
||||||
|
{"time": 1789701011.4385402, "available_gib": 172.5270233154297, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701013.4585543, "available_gib": 172.60058212280273, "oom_kill": 0, "gpu": "82221, 85651, 0, 38", "stop": false}
|
||||||
|
{"time": 1789701015.4818747, "available_gib": 172.59307861328125, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701017.5061588, "available_gib": 172.59432220458984, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701019.530188, "available_gib": 172.6073226928711, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701021.5538406, "available_gib": 172.6079559326172, "oom_kill": 0, "gpu": "82221, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789701023.577483, "available_gib": 172.60536575317383, "oom_kill": 0, "gpu": "82221, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789701025.602009, "available_gib": 172.61608505249023, "oom_kill": 0, "gpu": "82221, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789701027.6346726, "available_gib": 172.59850692749023, "oom_kill": 0, "gpu": "82221, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789701029.655618, "available_gib": 172.61746215820312, "oom_kill": 0, "gpu": "82221, 85651, 18, 44", "stop": false}
|
||||||
|
{"time": 1789701031.680679, "available_gib": 172.60479354858398, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701033.7067103, "available_gib": 172.59173965454102, "oom_kill": 0, "gpu": "82221, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789701035.7307365, "available_gib": 172.59384155273438, "oom_kill": 0, "gpu": "82221, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789701037.755291, "available_gib": 172.59645462036133, "oom_kill": 0, "gpu": "82221, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789701039.7799065, "available_gib": 172.59360122680664, "oom_kill": 0, "gpu": "82221, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789701041.806371, "available_gib": 172.5948600769043, "oom_kill": 0, "gpu": "82221, 85651, 100, 54", "stop": false}
|
||||||
|
{"time": 1789701043.831241, "available_gib": 172.6029052734375, "oom_kill": 0, "gpu": "82221, 85651, 100, 55", "stop": false}
|
||||||
|
{"time": 1789701045.851583, "available_gib": 172.59850311279297, "oom_kill": 0, "gpu": "82221, 85651, 0, 46", "stop": false}
|
||||||
|
{"time": 1789701047.87159, "available_gib": 172.60119247436523, "oom_kill": 0, "gpu": "82221, 85651, 0, 45", "stop": false}
|
||||||
|
{"time": 1789701049.891414, "available_gib": 172.60491561889648, "oom_kill": 0, "gpu": "82221, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789701051.9115524, "available_gib": 172.60918807983398, "oom_kill": 0, "gpu": "82221, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789701053.9315948, "available_gib": 172.5908660888672, "oom_kill": 0, "gpu": "82221, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789701055.9516313, "available_gib": 172.59875869750977, "oom_kill": 0, "gpu": "82221, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789701057.9717956, "available_gib": 172.59656524658203, "oom_kill": 0, "gpu": "82221, 85651, 0, 41", "stop": false}
|
||||||
|
{"time": 1789701059.9918897, "available_gib": 172.60762405395508, "oom_kill": 0, "gpu": "82221, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789701062.0123878, "available_gib": 172.60838317871094, "oom_kill": 0, "gpu": "82221, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789701064.0326827, "available_gib": 172.5976905822754, "oom_kill": 0, "gpu": "82221, 85651, 0, 40", "stop": false}
|
||||||
|
{"time": 1789701066.0526142, "available_gib": 172.6017074584961, "oom_kill": 0, "gpu": "82221, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789701068.0723028, "available_gib": 172.59253311157227, "oom_kill": 0, "gpu": "82221, 85651, 0, 39", "stop": false}
|
||||||
|
{"time": 1789701070.0969033, "available_gib": 172.5877571105957, "oom_kill": 0, "gpu": "82221, 85651, 100, 43", "stop": false}
|
||||||
|
{"time": 1789701072.1230333, "available_gib": 172.59381484985352, "oom_kill": 0, "gpu": "82221, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789701074.1478133, "available_gib": 172.59961318969727, "oom_kill": 0, "gpu": "82221, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789701076.1730917, "available_gib": 172.60650253295898, "oom_kill": 0, "gpu": "82221, 85651, 100, 44", "stop": false}
|
||||||
|
{"time": 1789701078.2044399, "available_gib": 172.5995864868164, "oom_kill": 0, "gpu": "82221, 85651, 73, 44", "stop": false}
|
||||||
|
{"time": 1789701080.22995, "available_gib": 172.60533905029297, "oom_kill": 0, "gpu": "82221, 85651, 100, 45", "stop": false}
|
||||||
|
{"time": 1789701082.2546062, "available_gib": 172.6151123046875, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701084.2766523, "available_gib": 172.19568252563477, "oom_kill": 0, "gpu": "82221, 85651, 45, 42", "stop": false}
|
||||||
|
{"time": 1789701086.3017826, "available_gib": 172.58774185180664, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701088.3262222, "available_gib": 172.59096145629883, "oom_kill": 0, "gpu": "82221, 85651, 100, 51", "stop": false}
|
||||||
|
{"time": 1789701090.3519824, "available_gib": 172.59814071655273, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701092.3774076, "available_gib": 172.5894889831543, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701094.4038262, "available_gib": 172.58403778076172, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701096.429996, "available_gib": 172.59373092651367, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701098.4556298, "available_gib": 172.59096908569336, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789701100.4818745, "available_gib": 172.5954132080078, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701102.5073426, "available_gib": 172.59514617919922, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701104.532404, "available_gib": 172.58914947509766, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701106.557216, "available_gib": 172.5836296081543, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701108.582627, "available_gib": 172.58819961547852, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701110.608039, "available_gib": 172.59086990356445, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701112.633599, "available_gib": 172.60618209838867, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701114.658857, "available_gib": 172.59781646728516, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701116.6843078, "available_gib": 172.60192489624023, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701118.7100747, "available_gib": 172.6135711669922, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701120.734327, "available_gib": 172.6045036315918, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701122.7618494, "available_gib": 172.59469985961914, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701124.7881503, "available_gib": 172.58696365356445, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701126.8136613, "available_gib": 172.58406448364258, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701128.8390074, "available_gib": 172.58839416503906, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701130.864569, "available_gib": 172.58028030395508, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789701132.8899226, "available_gib": 172.58873748779297, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701134.9153814, "available_gib": 172.5864486694336, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701136.9404318, "available_gib": 172.5959014892578, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701138.9656203, "available_gib": 172.58434295654297, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701140.9910595, "available_gib": 172.58267974853516, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701143.0166988, "available_gib": 172.59197616577148, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701145.0420861, "available_gib": 172.58642959594727, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701147.067009, "available_gib": 172.59386444091797, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701149.0934489, "available_gib": 172.59182357788086, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701151.1187055, "available_gib": 172.59437561035156, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701153.1445398, "available_gib": 172.60891723632812, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701155.1694057, "available_gib": 172.59935760498047, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701157.1940153, "available_gib": 172.59697341918945, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701159.219397, "available_gib": 172.60454559326172, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701161.2452264, "available_gib": 172.59120559692383, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701163.2706463, "available_gib": 172.58009338378906, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701165.295328, "available_gib": 172.5737762451172, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701167.320208, "available_gib": 172.58423614501953, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701169.3454485, "available_gib": 172.59298706054688, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701171.3705368, "available_gib": 172.59093856811523, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701173.3961673, "available_gib": 172.59422302246094, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701175.4216995, "available_gib": 172.58158493041992, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701177.4475298, "available_gib": 172.59367752075195, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701179.4727905, "available_gib": 172.5867462158203, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701181.4982638, "available_gib": 172.5999870300293, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701183.523508, "available_gib": 172.59864044189453, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701185.5483553, "available_gib": 172.59566116333008, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701187.5740483, "available_gib": 172.60041427612305, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701189.599319, "available_gib": 172.60073852539062, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701191.6244144, "available_gib": 172.60036849975586, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701193.649442, "available_gib": 172.5983428955078, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701195.6745589, "available_gib": 172.57711029052734, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701197.699769, "available_gib": 172.58396911621094, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701199.7248127, "available_gib": 172.5980224609375, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701201.7499073, "available_gib": 172.57787322998047, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701203.7740417, "available_gib": 172.5991668701172, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701205.798409, "available_gib": 172.5895538330078, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701207.8229227, "available_gib": 172.5818862915039, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701209.8532825, "available_gib": 172.57728958129883, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701211.878545, "available_gib": 172.58461380004883, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701213.9044034, "available_gib": 172.58068466186523, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701215.9295833, "available_gib": 172.5757179260254, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701217.9550774, "available_gib": 172.5826072692871, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701219.9804723, "available_gib": 172.59595489501953, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701222.0059063, "available_gib": 172.5900115966797, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701224.0320911, "available_gib": 172.5841941833496, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701226.057227, "available_gib": 172.58330154418945, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701228.0824344, "available_gib": 172.57609176635742, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701230.1073442, "available_gib": 172.58332061767578, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701232.1330707, "available_gib": 172.5820655822754, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701234.1588936, "available_gib": 172.58197784423828, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701236.1842837, "available_gib": 172.5815086364746, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701238.2095869, "available_gib": 172.57833862304688, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701240.234684, "available_gib": 172.57476425170898, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701242.259675, "available_gib": 172.58432388305664, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701244.285031, "available_gib": 172.5784568786621, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701246.3103218, "available_gib": 172.5804786682129, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701248.335566, "available_gib": 172.5905876159668, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701250.3602993, "available_gib": 172.59209823608398, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701252.3847375, "available_gib": 172.58996200561523, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701254.4165387, "available_gib": 172.5930290222168, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701256.441482, "available_gib": 172.57963180541992, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701258.4672883, "available_gib": 172.5902328491211, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701260.493391, "available_gib": 172.59453201293945, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701262.518649, "available_gib": 172.5939826965332, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701264.5439196, "available_gib": 172.59560012817383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701266.5690613, "available_gib": 172.5844383239746, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701268.5947351, "available_gib": 172.58787536621094, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701270.6198635, "available_gib": 172.58000946044922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701272.6449282, "available_gib": 172.58173751831055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701274.670806, "available_gib": 172.58299255371094, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701276.6965811, "available_gib": 172.57134628295898, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701278.721838, "available_gib": 172.5714340209961, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701280.7471697, "available_gib": 172.56920623779297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701282.7723398, "available_gib": 172.57240676879883, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701284.7982845, "available_gib": 172.55653762817383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701286.8235304, "available_gib": 172.5649299621582, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701288.848802, "available_gib": 172.56626510620117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701290.8738186, "available_gib": 172.56900024414062, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701292.8994768, "available_gib": 172.58038330078125, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701294.9242842, "available_gib": 172.5761833190918, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701296.9501328, "available_gib": 172.58355331420898, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701298.9773195, "available_gib": 172.5887336730957, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701301.0026333, "available_gib": 172.5791778564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701303.0277333, "available_gib": 172.5875129699707, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701305.0533764, "available_gib": 172.57394790649414, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701307.078638, "available_gib": 172.57233047485352, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701309.1042526, "available_gib": 172.59769439697266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701311.1296422, "available_gib": 172.5901641845703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701313.1546583, "available_gib": 172.5851936340332, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701315.1798072, "available_gib": 172.5773811340332, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701317.205347, "available_gib": 172.56993103027344, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701319.2306674, "available_gib": 172.58430099487305, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701321.2555065, "available_gib": 172.57866668701172, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701323.2809293, "available_gib": 172.5780906677246, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701325.3071644, "available_gib": 172.57109832763672, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701327.3321328, "available_gib": 172.57019424438477, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701329.3573031, "available_gib": 172.56019592285156, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701331.3826845, "available_gib": 172.56696701049805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701333.4079306, "available_gib": 172.56804275512695, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701335.433171, "available_gib": 172.5786476135254, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701337.4577425, "available_gib": 172.59429168701172, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701339.4828494, "available_gib": 172.5874137878418, "oom_kill": 0, "gpu": "82221, 85651, 73, 48", "stop": false}
|
||||||
|
{"time": 1789701341.513143, "available_gib": 172.58463668823242, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701343.5377994, "available_gib": 172.59532928466797, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701345.5634289, "available_gib": 172.58687210083008, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701347.5886683, "available_gib": 172.57830429077148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701349.6142716, "available_gib": 172.56749725341797, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701351.6394491, "available_gib": 172.59222412109375, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701353.6647067, "available_gib": 172.58797454833984, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701355.6897626, "available_gib": 172.5839729309082, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701357.7143347, "available_gib": 172.5797348022461, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701359.7392793, "available_gib": 172.57365798950195, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701361.764416, "available_gib": 172.58184051513672, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701363.7895935, "available_gib": 172.59668350219727, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701365.8145492, "available_gib": 172.5975799560547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701367.8397129, "available_gib": 172.59506607055664, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701369.8646264, "available_gib": 172.5967559814453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701371.8896255, "available_gib": 172.5984764099121, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701373.9147854, "available_gib": 172.5869903564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701375.9405391, "available_gib": 172.60964584350586, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701377.965826, "available_gib": 172.59958267211914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701379.991387, "available_gib": 172.59263229370117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701382.0160408, "available_gib": 172.60515975952148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701384.0404425, "available_gib": 172.61307907104492, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701386.0696607, "available_gib": 172.6041374206543, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701388.095149, "available_gib": 172.6212921142578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701390.1210837, "available_gib": 172.61275482177734, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701392.1464388, "available_gib": 172.6175765991211, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701394.1724389, "available_gib": 172.6160125732422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701396.198181, "available_gib": 172.6087989807129, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701398.2236202, "available_gib": 172.60551834106445, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701400.249441, "available_gib": 172.61298751831055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701402.275542, "available_gib": 172.58788681030273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701404.3007076, "available_gib": 172.60507202148438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701406.325865, "available_gib": 172.59299850463867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701408.3511186, "available_gib": 172.58581924438477, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701410.3762531, "available_gib": 172.58404541015625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701412.4014342, "available_gib": 172.58259963989258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701414.426254, "available_gib": 172.57210159301758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701416.4512775, "available_gib": 172.55726623535156, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701418.4756846, "available_gib": 172.57417678833008, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701420.5007942, "available_gib": 172.56461715698242, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701422.5264719, "available_gib": 172.58109664916992, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701424.5513623, "available_gib": 172.58324813842773, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701426.5760825, "available_gib": 172.57038497924805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701428.600188, "available_gib": 172.54417037963867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701430.6254475, "available_gib": 172.56795120239258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701432.6508305, "available_gib": 172.56864166259766, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701434.6763918, "available_gib": 172.57247924804688, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701436.7016013, "available_gib": 172.570556640625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701438.726821, "available_gib": 172.56969451904297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701440.7522132, "available_gib": 172.58348846435547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701442.7773013, "available_gib": 172.58907318115234, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701444.8028224, "available_gib": 172.58137130737305, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701446.8280888, "available_gib": 172.58168411254883, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701448.8537333, "available_gib": 172.59582901000977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701450.8796225, "available_gib": 172.58771514892578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701452.904568, "available_gib": 172.59309768676758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701454.9296691, "available_gib": 172.59248733520508, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701456.9559731, "available_gib": 172.57843780517578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701458.9811213, "available_gib": 172.58196258544922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701461.0063386, "available_gib": 172.5785675048828, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701463.031627, "available_gib": 172.59744262695312, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701465.0566003, "available_gib": 172.58345794677734, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701467.0813305, "available_gib": 172.58057403564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701469.10658, "available_gib": 172.57833099365234, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701471.131397, "available_gib": 172.5915184020996, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701473.1605394, "available_gib": 172.57442092895508, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701475.1865551, "available_gib": 172.5938606262207, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701477.2132208, "available_gib": 172.59685134887695, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701479.2393854, "available_gib": 172.59960556030273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701481.2653015, "available_gib": 172.59103775024414, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701483.2913888, "available_gib": 172.60277938842773, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701485.3170993, "available_gib": 172.59246063232422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701487.3426304, "available_gib": 172.57929611206055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701489.3685524, "available_gib": 172.58928298950195, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701491.3942213, "available_gib": 172.5861358642578, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701493.4197087, "available_gib": 172.59406661987305, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701495.44533, "available_gib": 172.60776138305664, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701497.470885, "available_gib": 172.5911979675293, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701499.4961631, "available_gib": 172.58167266845703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701501.5222428, "available_gib": 172.5778923034668, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701503.548063, "available_gib": 172.5721206665039, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701505.574339, "available_gib": 172.58111953735352, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701507.5996683, "available_gib": 172.57108688354492, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701509.6243296, "available_gib": 172.57672119140625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701511.6494763, "available_gib": 172.57176971435547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701513.6742258, "available_gib": 172.5694351196289, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701515.6996827, "available_gib": 172.57966232299805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701517.729931, "available_gib": 172.56555938720703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701519.7558725, "available_gib": 172.5787696838379, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701521.7816515, "available_gib": 172.5869255065918, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701523.8070703, "available_gib": 172.589111328125, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701525.8330855, "available_gib": 172.59806442260742, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701527.8596637, "available_gib": 172.59344482421875, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701529.8850842, "available_gib": 172.59644317626953, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701531.9103887, "available_gib": 172.60001373291016, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701533.9355912, "available_gib": 172.57942581176758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701535.9618225, "available_gib": 172.5786247253418, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701537.9875653, "available_gib": 172.5797882080078, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701540.0123587, "available_gib": 172.57340621948242, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701542.0381427, "available_gib": 172.58515548706055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701544.0633168, "available_gib": 172.58974075317383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701546.0888603, "available_gib": 172.58939361572266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701548.1139224, "available_gib": 172.5757713317871, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701550.1394584, "available_gib": 172.59507369995117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701552.1640782, "available_gib": 172.60289001464844, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789701554.1836874, "available_gib": 172.58774948120117, "oom_kill": 0, "gpu": "82221, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789701556.2081735, "available_gib": 172.5525360107422, "oom_kill": 0, "gpu": "82221, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789701558.2341785, "available_gib": 172.57128143310547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701560.2591348, "available_gib": 172.57971954345703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701562.2944648, "available_gib": 172.5814971923828, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701564.3195987, "available_gib": 172.57781600952148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701566.3450398, "available_gib": 172.58513641357422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701568.3706362, "available_gib": 172.58678436279297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701570.3957126, "available_gib": 172.5864143371582, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701572.4211404, "available_gib": 172.58766555786133, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701574.4463472, "available_gib": 172.5813217163086, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701576.4714487, "available_gib": 172.58770370483398, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701578.49706, "available_gib": 172.5774040222168, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701580.5228672, "available_gib": 172.5824966430664, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701582.5493217, "available_gib": 172.58685302734375, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701584.5748284, "available_gib": 172.5976104736328, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701586.6011412, "available_gib": 172.58838653564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701588.6268916, "available_gib": 172.59243392944336, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701590.652059, "available_gib": 172.58749389648438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701592.6771092, "available_gib": 172.58115005493164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701594.7025795, "available_gib": 172.57364654541016, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701596.7276702, "available_gib": 172.5721092224121, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701598.7538807, "available_gib": 172.5766258239746, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701600.778985, "available_gib": 172.5940704345703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701602.8044167, "available_gib": 172.58226013183594, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701604.8302257, "available_gib": 172.59600830078125, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701606.8556921, "available_gib": 172.5946159362793, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701608.8812172, "available_gib": 172.58676147460938, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701610.906736, "available_gib": 172.58494186401367, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701612.9321215, "available_gib": 172.5849723815918, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701614.957506, "available_gib": 172.58665466308594, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701616.9826908, "available_gib": 172.57427215576172, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701619.0075603, "available_gib": 172.57586288452148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701621.0327103, "available_gib": 172.576416015625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701623.0581641, "available_gib": 172.57623672485352, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701625.0839252, "available_gib": 172.5754280090332, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701627.1093912, "available_gib": 172.57783126831055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701629.1343644, "available_gib": 172.5789909362793, "oom_kill": 0, "gpu": "82221, 85651, 82, 52", "stop": false}
|
||||||
|
{"time": 1789701631.1590383, "available_gib": 172.58367538452148, "oom_kill": 0, "gpu": "82221, 85651, 100, 52", "stop": false}
|
||||||
|
{"time": 1789701633.1843386, "available_gib": 172.57455444335938, "oom_kill": 0, "gpu": "82221, 85651, 91, 49", "stop": false}
|
||||||
|
{"time": 1789701635.209368, "available_gib": 172.58202743530273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701637.234487, "available_gib": 172.57379150390625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701639.2598283, "available_gib": 172.5713882446289, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701641.2847302, "available_gib": 172.57542037963867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701643.3108444, "available_gib": 172.5716552734375, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701645.3365302, "available_gib": 172.56243515014648, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701647.361179, "available_gib": 172.57072830200195, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701649.3865967, "available_gib": 172.55943298339844, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701651.412058, "available_gib": 172.57709503173828, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701653.4381099, "available_gib": 172.58160781860352, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701655.4637282, "available_gib": 172.58842849731445, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701657.489165, "available_gib": 172.5929069519043, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701659.5144625, "available_gib": 172.58607864379883, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701661.5399368, "available_gib": 172.5964012145996, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701663.5652285, "available_gib": 172.58932876586914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701665.5902624, "available_gib": 172.58665084838867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701667.6160378, "available_gib": 172.5975227355957, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701669.6414084, "available_gib": 172.57087326049805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701671.6665998, "available_gib": 172.57537078857422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701673.691885, "available_gib": 172.57130813598633, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701675.717851, "available_gib": 172.56243133544922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701677.7433789, "available_gib": 172.57289505004883, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701679.7685795, "available_gib": 172.55965042114258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701681.7939448, "available_gib": 172.5418357849121, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701683.818601, "available_gib": 172.54984283447266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701685.8437698, "available_gib": 172.54569625854492, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701687.8682926, "available_gib": 172.53528213500977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701689.8979602, "available_gib": 172.53655242919922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701691.9233189, "available_gib": 172.56979370117188, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701693.9493823, "available_gib": 172.57160186767578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701695.9751203, "available_gib": 172.5727767944336, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701698.0001209, "available_gib": 172.57454681396484, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701700.0254836, "available_gib": 172.58499908447266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701702.0511165, "available_gib": 172.58174896240234, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701704.0765002, "available_gib": 172.59303665161133, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701706.102048, "available_gib": 172.59952545166016, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701708.1272569, "available_gib": 172.5937271118164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701710.1528327, "available_gib": 172.59798049926758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701712.179151, "available_gib": 172.59679794311523, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701714.2048182, "available_gib": 172.59318923950195, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701716.2302368, "available_gib": 172.58661270141602, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701718.255557, "available_gib": 172.6129264831543, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701720.280853, "available_gib": 172.60049057006836, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701722.3062806, "available_gib": 172.6060333251953, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701724.331961, "available_gib": 172.60340881347656, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701726.357684, "available_gib": 172.60736465454102, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701728.383129, "available_gib": 172.6104278564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701730.4083083, "available_gib": 172.60208892822266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701732.432774, "available_gib": 172.58456420898438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701734.4592667, "available_gib": 172.5871238708496, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701736.4853003, "available_gib": 172.58650588989258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701738.510835, "available_gib": 172.58515548706055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701740.5363302, "available_gib": 172.59296798706055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701742.5622935, "available_gib": 172.58935928344727, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701744.5877223, "available_gib": 172.58443069458008, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701746.6138322, "available_gib": 172.57342147827148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701748.6408284, "available_gib": 172.57418823242188, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701750.6660724, "available_gib": 172.5688705444336, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701752.691097, "available_gib": 172.56679916381836, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701754.716793, "available_gib": 172.57676696777344, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701756.7431898, "available_gib": 172.58455276489258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701758.7686796, "available_gib": 172.57971572875977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701760.7937856, "available_gib": 172.5875358581543, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701762.8190825, "available_gib": 172.5849723815918, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701764.8442044, "available_gib": 172.5857925415039, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701766.8694155, "available_gib": 172.5851707458496, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701768.8939133, "available_gib": 172.58845138549805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701770.9187613, "available_gib": 172.58480834960938, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701772.9437819, "available_gib": 172.58863067626953, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701774.968475, "available_gib": 172.58881759643555, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701776.995814, "available_gib": 172.5693588256836, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701779.021607, "available_gib": 172.59856414794922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701781.0472794, "available_gib": 172.59430694580078, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701783.0726926, "available_gib": 172.58967971801758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701785.0980303, "available_gib": 172.59542846679688, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701787.1234996, "available_gib": 172.60084533691406, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701789.149796, "available_gib": 172.58984756469727, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701791.1747415, "available_gib": 172.58871459960938, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701793.1999857, "available_gib": 172.59915161132812, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701795.2287428, "available_gib": 172.59922409057617, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701797.2538633, "available_gib": 172.57601165771484, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701799.2789068, "available_gib": 172.58044815063477, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701801.3039634, "available_gib": 172.5829086303711, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701803.3289883, "available_gib": 172.58263778686523, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701805.353576, "available_gib": 172.5821418762207, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701807.3784702, "available_gib": 172.5735969543457, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701809.4034743, "available_gib": 172.58712005615234, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701811.428601, "available_gib": 172.58792877197266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701813.4536796, "available_gib": 172.58675384521484, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701815.478769, "available_gib": 172.57906341552734, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701817.5036128, "available_gib": 172.57857131958008, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701819.5283303, "available_gib": 172.5829620361328, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701821.5588808, "available_gib": 172.5791358947754, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701823.5842583, "available_gib": 172.58655548095703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701825.6093478, "available_gib": 172.56943893432617, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701827.6344311, "available_gib": 172.5730743408203, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701829.6596322, "available_gib": 172.57406997680664, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701831.685154, "available_gib": 172.59062576293945, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701833.7111337, "available_gib": 172.5887794494629, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701835.7360468, "available_gib": 172.58557510375977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701837.7614975, "available_gib": 172.57565307617188, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701839.786718, "available_gib": 172.58143997192383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701841.8117237, "available_gib": 172.56843948364258, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701843.8366792, "available_gib": 172.57442092895508, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701845.8616753, "available_gib": 172.58721542358398, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701847.8864172, "available_gib": 172.58136749267578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701849.9113665, "available_gib": 172.5676727294922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701851.9362097, "available_gib": 172.56098175048828, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701853.9609416, "available_gib": 172.57102584838867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701855.985938, "available_gib": 172.58160018920898, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701858.0118465, "available_gib": 172.58536529541016, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701860.0368533, "available_gib": 172.59030532836914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701862.0616338, "available_gib": 172.57714462280273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701864.0865114, "available_gib": 172.5528335571289, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701866.1131222, "available_gib": 172.56980514526367, "oom_kill": 0, "gpu": "82221, 85651, 100, 53", "stop": false}
|
||||||
|
{"time": 1789701868.1377418, "available_gib": 172.6039047241211, "oom_kill": 0, "gpu": "82221, 85651, 19, 46", "stop": false}
|
||||||
|
{"time": 1789701870.163961, "available_gib": 172.59550857543945, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701872.1893556, "available_gib": 172.60084533691406, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701874.2153673, "available_gib": 172.58216857910156, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701876.2406929, "available_gib": 172.57574081420898, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701878.2666337, "available_gib": 172.56818771362305, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701880.2920647, "available_gib": 172.56893920898438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701882.3171022, "available_gib": 172.57630157470703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701884.343321, "available_gib": 172.57683944702148, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701886.3684945, "available_gib": 172.55793380737305, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701888.394166, "available_gib": 172.54576873779297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701890.419636, "available_gib": 172.5540428161621, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701892.4449003, "available_gib": 172.57975387573242, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701894.469871, "available_gib": 172.59022521972656, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701896.4950423, "available_gib": 172.57782363891602, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701898.5200713, "available_gib": 172.58166885375977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701900.545797, "available_gib": 172.5880012512207, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701902.5716953, "available_gib": 172.59612655639648, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701904.5970962, "available_gib": 172.59884643554688, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701906.6222715, "available_gib": 172.5963478088379, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701908.651383, "available_gib": 172.58456420898438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701910.676585, "available_gib": 172.57962799072266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701912.7014875, "available_gib": 172.57934188842773, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701914.7267983, "available_gib": 172.5641326904297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701916.7516634, "available_gib": 172.5559425354004, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701918.7769113, "available_gib": 172.55651092529297, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701920.8028145, "available_gib": 172.5674819946289, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701922.828126, "available_gib": 172.58087539672852, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701924.8533573, "available_gib": 172.57255172729492, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701926.8784873, "available_gib": 172.56937408447266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701928.903472, "available_gib": 172.55810165405273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701930.9284837, "available_gib": 172.56466674804688, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701932.9538572, "available_gib": 172.57559204101562, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701934.9795036, "available_gib": 172.57039642333984, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701937.0046694, "available_gib": 172.5717010498047, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701939.0306034, "available_gib": 172.56853485107422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701941.055516, "available_gib": 172.55942153930664, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701943.0805852, "available_gib": 172.55847930908203, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701945.107148, "available_gib": 172.5767707824707, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701947.132062, "available_gib": 172.58729934692383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701949.1569493, "available_gib": 172.58234024047852, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701951.1820776, "available_gib": 172.57572174072266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701953.2080014, "available_gib": 172.5902557373047, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701955.2334707, "available_gib": 172.5779571533203, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701957.2585127, "available_gib": 172.58330535888672, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701959.28374, "available_gib": 172.59075164794922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701961.3094802, "available_gib": 172.57587051391602, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701963.335144, "available_gib": 172.58037185668945, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701965.3599043, "available_gib": 172.57882690429688, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701967.3852284, "available_gib": 172.5793685913086, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701969.410783, "available_gib": 172.57703018188477, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701971.4362624, "available_gib": 172.57270050048828, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701973.461335, "available_gib": 172.5732078552246, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701975.4866421, "available_gib": 172.5632209777832, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701977.5117586, "available_gib": 172.57760620117188, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701979.537557, "available_gib": 172.55998611450195, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701981.5634415, "available_gib": 172.5766716003418, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701983.5885694, "available_gib": 172.57590866088867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701985.6136754, "available_gib": 172.573974609375, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701987.6390464, "available_gib": 172.56972122192383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701989.6639197, "available_gib": 172.56299591064453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701991.6889935, "available_gib": 172.54843521118164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701993.7141998, "available_gib": 172.55016708374023, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701995.7397015, "available_gib": 172.53079986572266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701997.764821, "available_gib": 172.55815505981445, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789701999.789609, "available_gib": 172.5791778564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702001.8149865, "available_gib": 172.57715606689453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702003.8409283, "available_gib": 172.57036590576172, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702005.866604, "available_gib": 172.57094955444336, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702007.89155, "available_gib": 172.5634536743164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702009.91701, "available_gib": 172.57282257080078, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702011.9423645, "available_gib": 172.56839752197266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702013.9678352, "available_gib": 172.5768928527832, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702015.9933739, "available_gib": 172.5766716003418, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702018.0187628, "available_gib": 172.56442642211914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702020.043583, "available_gib": 172.56250381469727, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702022.068601, "available_gib": 172.54801177978516, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702024.094419, "available_gib": 172.54723739624023, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702026.1207678, "available_gib": 172.55731582641602, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702028.1459088, "available_gib": 172.55868530273438, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702030.1715555, "available_gib": 172.54986190795898, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702032.1964123, "available_gib": 172.5380401611328, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702034.2211792, "available_gib": 172.56396484375, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702036.2468033, "available_gib": 172.55551147460938, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702038.2711494, "available_gib": 172.55274963378906, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702040.3007915, "available_gib": 172.55873489379883, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702042.3261206, "available_gib": 172.55894088745117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702044.3512168, "available_gib": 172.56040573120117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702046.3769698, "available_gib": 172.5804557800293, "oom_kill": 0, "gpu": "82221, 85651, 100, 50", "stop": false}
|
||||||
|
{"time": 1789702048.402391, "available_gib": 172.57236099243164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702050.4272742, "available_gib": 172.56317520141602, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702052.4528203, "available_gib": 172.57676315307617, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702054.4783747, "available_gib": 172.5846061706543, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702056.5036144, "available_gib": 172.58479690551758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702058.529007, "available_gib": 172.58444595336914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702060.5541472, "available_gib": 172.57077407836914, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702062.5794454, "available_gib": 172.57500076293945, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702064.6045363, "available_gib": 172.5793228149414, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702066.6308293, "available_gib": 172.58983993530273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702068.6557114, "available_gib": 172.59182739257812, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702070.6813586, "available_gib": 172.59394454956055, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702072.7069104, "available_gib": 172.59359741210938, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702074.7323215, "available_gib": 172.59983444213867, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702076.757261, "available_gib": 172.59705352783203, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702078.7824743, "available_gib": 172.58372497558594, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702080.8072298, "available_gib": 172.56373977661133, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702082.8321702, "available_gib": 172.5644989013672, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702084.857955, "available_gib": 172.57424926757812, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702086.884065, "available_gib": 172.57580947875977, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702088.909556, "available_gib": 172.58199310302734, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702090.9347992, "available_gib": 172.58757781982422, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702092.959785, "available_gib": 172.58831024169922, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702094.9847803, "available_gib": 172.58932495117188, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702097.010041, "available_gib": 172.57978057861328, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702099.0360284, "available_gib": 172.5731315612793, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702101.0611684, "available_gib": 172.5887908935547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702103.0861444, "available_gib": 172.57111358642578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702105.1120791, "available_gib": 172.58562088012695, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702107.1381004, "available_gib": 172.59576416015625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702109.1642268, "available_gib": 172.60303497314453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702111.1894739, "available_gib": 172.58353424072266, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702113.2155256, "available_gib": 172.5862579345703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702115.240877, "available_gib": 172.60155487060547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702117.266522, "available_gib": 172.6023063659668, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702119.2930028, "available_gib": 172.60486221313477, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702121.3182144, "available_gib": 172.5972023010254, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702123.3439672, "available_gib": 172.5996971130371, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702125.3695095, "available_gib": 172.587890625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702127.394833, "available_gib": 172.5743865966797, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702129.4216254, "available_gib": 172.5852813720703, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702131.447643, "available_gib": 172.5972900390625, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702133.47329, "available_gib": 172.57948684692383, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702135.4993463, "available_gib": 172.57838439941406, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702137.525227, "available_gib": 172.57657623291016, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702139.550804, "available_gib": 172.58440780639648, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702141.5758045, "available_gib": 172.58594131469727, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702143.6031094, "available_gib": 172.57714080810547, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702145.630667, "available_gib": 172.58349227905273, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702147.6557918, "available_gib": 172.5879898071289, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702149.680846, "available_gib": 172.57311630249023, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702151.7057874, "available_gib": 172.5579490661621, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702153.730593, "available_gib": 172.5606346130371, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702155.7558193, "available_gib": 172.58108139038086, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702157.7811522, "available_gib": 172.5773468017578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702159.806453, "available_gib": 172.57622146606445, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702161.8317628, "available_gib": 172.56987762451172, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702163.8575466, "available_gib": 172.56770706176758, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702165.8828206, "available_gib": 172.59180450439453, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702167.908501, "available_gib": 172.58283233642578, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702169.9340818, "available_gib": 172.58452224731445, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702171.9645386, "available_gib": 172.59285736083984, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702173.9900215, "available_gib": 172.59605026245117, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702176.0158706, "available_gib": 172.5884895324707, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702178.0424218, "available_gib": 172.57983016967773, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702180.0678997, "available_gib": 172.5829734802246, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702182.0938838, "available_gib": 172.5905418395996, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702184.1201942, "available_gib": 172.58356857299805, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702186.1474605, "available_gib": 172.60574340820312, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702188.1745293, "available_gib": 172.5859146118164, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702190.200833, "available_gib": 172.5963478088379, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702192.2267869, "available_gib": 172.5945167541504, "oom_kill": 0, "gpu": "82221, 85651, 100, 49", "stop": false}
|
||||||
|
{"time": 1789702194.2470593, "available_gib": 172.6099739074707, "oom_kill": 0, "gpu": "82221, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789702196.2671714, "available_gib": 172.61085510253906, "oom_kill": 0, "gpu": "82221, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789702198.28799, "available_gib": 172.59737014770508, "oom_kill": 0, "gpu": "82221, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789702200.3078485, "available_gib": 172.5998649597168, "oom_kill": 0, "gpu": "82221, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789702202.334467, "available_gib": 172.58883666992188, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789702204.3604066, "available_gib": 172.59357833862305, "oom_kill": 0, "gpu": "82221, 85651, 100, 46", "stop": false}
|
||||||
|
{"time": 1789702206.385876, "available_gib": 172.59391021728516, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702208.4112082, "available_gib": 172.5895881652832, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702210.4360843, "available_gib": 172.60638046264648, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702212.460894, "available_gib": 172.59789657592773, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702214.4860547, "available_gib": 172.60935592651367, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702216.5155327, "available_gib": 172.5929069519043, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702218.5409086, "available_gib": 172.5972900390625, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702220.5664692, "available_gib": 172.59519958496094, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702222.5915594, "available_gib": 172.59796524047852, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702224.616894, "available_gib": 172.6077880859375, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702226.6424074, "available_gib": 172.60299682617188, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702228.6684818, "available_gib": 172.59063720703125, "oom_kill": 0, "gpu": "82221, 85651, 100, 47", "stop": false}
|
||||||
|
{"time": 1789702230.6945899, "available_gib": 172.60198211669922, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702232.7195122, "available_gib": 172.6161117553711, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702234.745604, "available_gib": 172.61327362060547, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702236.7713733, "available_gib": 172.6204719543457, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702238.7965298, "available_gib": 172.5970573425293, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702240.8220792, "available_gib": 172.61005401611328, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702242.8471224, "available_gib": 172.61499786376953, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702244.8725712, "available_gib": 172.59759140014648, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702246.8975356, "available_gib": 172.60516738891602, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702248.9228303, "available_gib": 172.59686279296875, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702250.9477427, "available_gib": 172.59595108032227, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702252.972987, "available_gib": 172.59438705444336, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702254.998834, "available_gib": 172.61806106567383, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702257.0253954, "available_gib": 172.60887908935547, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702259.0496767, "available_gib": 172.59528732299805, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702261.0767696, "available_gib": 172.61063385009766, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702263.1025488, "available_gib": 172.60060119628906, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702265.1280937, "available_gib": 172.60254287719727, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702267.1533968, "available_gib": 172.61304092407227, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702269.1798592, "available_gib": 172.60343170166016, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702271.2058144, "available_gib": 172.6044044494629, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702273.2313154, "available_gib": 172.6026153564453, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702275.2555737, "available_gib": 172.60955810546875, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702277.2813663, "available_gib": 172.5975456237793, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702279.3065827, "available_gib": 172.59769821166992, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702281.3326733, "available_gib": 172.58937072753906, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702283.358162, "available_gib": 172.60459899902344, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702285.3837855, "available_gib": 172.60452270507812, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702287.409086, "available_gib": 172.61359024047852, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702289.4343593, "available_gib": 172.60725784301758, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702291.460028, "available_gib": 172.60640716552734, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702293.4853837, "available_gib": 172.60386276245117, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702295.510582, "available_gib": 172.60206985473633, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702297.5353544, "available_gib": 172.59392547607422, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702299.5603993, "available_gib": 172.58969497680664, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702301.5855772, "available_gib": 172.59707260131836, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702303.6140127, "available_gib": 172.61371231079102, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702305.639136, "available_gib": 172.61707305908203, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702307.6641486, "available_gib": 172.5890769958496, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702309.689121, "available_gib": 172.58383560180664, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702311.7141328, "available_gib": 172.58949661254883, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702313.7398663, "available_gib": 172.59199142456055, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702315.764659, "available_gib": 172.6090850830078, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702317.789703, "available_gib": 172.60089111328125, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702319.8143446, "available_gib": 172.60480117797852, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702321.8395247, "available_gib": 172.60055541992188, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702323.864664, "available_gib": 172.60891723632812, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702325.8898253, "available_gib": 172.59312057495117, "oom_kill": 0, "gpu": "82221, 85651, 100, 48", "stop": false}
|
||||||
|
{"time": 1789702327.910282, "available_gib": 174.50265502929688, "oom_kill": 0, "gpu": "82221, 85651, 0, 44", "stop": false}
|
||||||
|
{"time": 1789702329.930835, "available_gib": 175.24576568603516, "oom_kill": 0, "gpu": "82221, 85651, 0, 43", "stop": false}
|
||||||
|
{"time": 1789702331.9518807, "available_gib": 175.22011947631836, "oom_kill": 0, "gpu": "82221, 85651, 0, 42", "stop": false}
|
||||||
|
{"time": 1789702333.9729092, "available_gib": 175.1866912841797, "oom_kill": 0, "gpu": "82221, 85651, 0, 42", "stop": false}
|
||||||
@@ -0,0 +1,163 @@
|
|||||||
|
{
|
||||||
|
"baseline": {
|
||||||
|
"requests": 92,
|
||||||
|
"failures": [],
|
||||||
|
"timing": {
|
||||||
|
"code": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 77.09818266843658,
|
||||||
|
"ttft_s_median": 0.0694820829994569,
|
||||||
|
"elapsed_s_median": 26.619741354000325,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
2048,
|
||||||
|
2048,
|
||||||
|
2048
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"chinese": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 77.11985308389164,
|
||||||
|
"ttft_s_median": 0.0701422599995567,
|
||||||
|
"elapsed_s_median": 26.61247469099999,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
2048,
|
||||||
|
2048,
|
||||||
|
2048
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"reasoning": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 77.14088856875408,
|
||||||
|
"ttft_s_median": 0.06953137100026652,
|
||||||
|
"elapsed_s_median": 26.604923668000083,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
2037,
|
||||||
|
2037,
|
||||||
|
2037
|
||||||
|
]
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"soak": {
|
||||||
|
"requests": 54,
|
||||||
|
"sum_request_seconds": 623.7230764919932,
|
||||||
|
"failures": 0
|
||||||
|
},
|
||||||
|
"long_output": [
|
||||||
|
{
|
||||||
|
"name": "long-output-16384",
|
||||||
|
"passed": true,
|
||||||
|
"finish": "length",
|
||||||
|
"usage": {
|
||||||
|
"prompt_tokens": 75,
|
||||||
|
"total_tokens": 16459,
|
||||||
|
"completion_tokens": 16384,
|
||||||
|
"completion_tokens_details": {
|
||||||
|
"reasoning_tokens": 12136
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"ttft_s": 0.07076310200136504,
|
||||||
|
"elapsed_s": 213.90097701500054,
|
||||||
|
"decode_tps": 76.61686204301199,
|
||||||
|
"max_stream_gap_s": 0.03923290800048562,
|
||||||
|
"events": 16379,
|
||||||
|
"sha256": "163936c470f43d5ab67e21f8372d3bc876a5be12a4d5536777254f3f19513bdc"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"quality": {
|
||||||
|
"tasks": 7,
|
||||||
|
"failures": [
|
||||||
|
"merge-intervals"
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"quality_medium": {
|
||||||
|
"tasks": 7,
|
||||||
|
"failures": []
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"mtp2": {
|
||||||
|
"requests": 98,
|
||||||
|
"failures": [],
|
||||||
|
"timing": {
|
||||||
|
"code": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 123.41758452810322,
|
||||||
|
"ttft_s_median": 0.07591862499975832,
|
||||||
|
"elapsed_s_median": 16.6593724129998,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
2048,
|
||||||
|
2048,
|
||||||
|
2048
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"chinese": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 128.7806464346781,
|
||||||
|
"ttft_s_median": 0.072885381996457,
|
||||||
|
"elapsed_s_median": 15.979564499000844,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
182,
|
||||||
|
182,
|
||||||
|
182
|
||||||
|
]
|
||||||
|
},
|
||||||
|
"reasoning": {
|
||||||
|
"samples": 3,
|
||||||
|
"decode_tps_median": 122.14530767407761,
|
||||||
|
"ttft_s_median": 0.07294582499889657,
|
||||||
|
"elapsed_s_median": 16.830496447997575,
|
||||||
|
"reasoning_tokens": [
|
||||||
|
2048,
|
||||||
|
2048,
|
||||||
|
2048
|
||||||
|
]
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"soak": {
|
||||||
|
"requests": 60,
|
||||||
|
"sum_request_seconds": 614.0107337019508,
|
||||||
|
"failures": 0
|
||||||
|
},
|
||||||
|
"long_output": [
|
||||||
|
{
|
||||||
|
"name": "long-output-16384",
|
||||||
|
"passed": true,
|
||||||
|
"finish": "length",
|
||||||
|
"usage": {
|
||||||
|
"prompt_tokens": 75,
|
||||||
|
"total_tokens": 16459,
|
||||||
|
"completion_tokens": 16384,
|
||||||
|
"completion_tokens_details": {
|
||||||
|
"reasoning_tokens": 16384
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"ttft_s": 0.07230955999693833,
|
||||||
|
"elapsed_s": 115.18278583499341,
|
||||||
|
"decode_tps": 142.32414398895685,
|
||||||
|
"max_stream_gap_s": 0.01970133199938573,
|
||||||
|
"events": 6307,
|
||||||
|
"sha256": "580583cb4854d65556f20af2c05b29a82dad4c696bbc44d4d0476a50150458e5"
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"quality": {
|
||||||
|
"tasks": 7,
|
||||||
|
"failures": []
|
||||||
|
},
|
||||||
|
"quality_medium": {
|
||||||
|
"tasks": 7,
|
||||||
|
"failures": []
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"speedup": {
|
||||||
|
"code": 1.600784613288031,
|
||||||
|
"chinese": 1.6698767085900617,
|
||||||
|
"reasoning": 1.583405505696399
|
||||||
|
},
|
||||||
|
"resources": {
|
||||||
|
"samples": 1305,
|
||||||
|
"min_host_available_gib": 171.95434188842773,
|
||||||
|
"oom_kill_max": 0,
|
||||||
|
"safeguard_triggered": false,
|
||||||
|
"gpu_memory_peak_mib": 84797.0,
|
||||||
|
"gpu_temperature_peak_c": 64.0
|
||||||
|
}
|
||||||
|
}
|
||||||
@@ -1,5 +1,7 @@
|
|||||||
# 实机验收:2026-09-18
|
# 实机验收:2026-09-18
|
||||||
|
|
||||||
|
> 后续状态:已完成扩展 MTP 验证并启用 MTP 2;本文保留当时记录,当前结论见 [完整验证](../docs/mtp-qualification.md)。
|
||||||
|
|
||||||
机器:172.16.104.92,RTX 6000D 85651 MiB 显存、247 GiB 主机内存、16 vCPU、VMware。驱动 595.91.07。锁页内存 H2D 复制实测 57.81 GB/s,不能用虚拟 PCIe 链路显示值代替实测。
|
机器:172.16.104.92,RTX 6000D 85651 MiB 显存、247 GiB 主机内存、16 vCPU、VMware。驱动 595.91.07。锁页内存 H2D 复制实测 57.81 GB/s,不能用虚拟 PCIe 链路显示值代替实测。
|
||||||
|
|
||||||
## 最终基线
|
## 最终基线
|
||||||
|
|||||||
@@ -27,6 +27,6 @@
|
|||||||
|
|
||||||
实测:VMware 虚拟机、16 vCPU、247 GiB RAM、85651 MiB GPU 显存。原项目 96GB 显卡的显存预算和速度数据不作为本机验收证据。虚拟 PCIe 配置显示的链路不用于推断实际带宽。
|
实测:VMware 虚拟机、16 vCPU、247 GiB RAM、85651 MiB GPU 显存。原项目 96GB 显卡的显存预算和速度数据不作为本机验收证据。虚拟 PCIe 配置显示的链路不用于推断实际带宽。
|
||||||
|
|
||||||
已验证 CUDA 运算、PLE 锁页查表及量化缩放;依次完成 32K BF16 eager、128K FP8 eager、128K FP8 FULL CUDA Graph 验收。最终启用 128K 和 CUDA Graph;MTP 未启用。文字、工具调用、图片、视频、127988 token 输入检索均通过。详见 [验收结果](results.md)。
|
已验证 CUDA 运算、PLE 锁页查表及量化缩放;依次完成 32K BF16 eager、128K FP8 eager、128K FP8 FULL CUDA Graph 验收。初始启用 128K 和 CUDA Graph;随后完成扩展 MTP 验证并启用 MTP 2,见 [完整验证](../docs/mtp-qualification.md)。文字、工具调用、图片、视频、127988 token 输入检索均通过。详见 [验收结果](results.md)。
|
||||||
|
|
||||||
本审计是所选执行路径的代码审查和测试计划,不是全部第三方依赖的安全认证。
|
本审计是所选执行路径的代码审查和测试计划,不是全部第三方依赖的安全认证。
|
||||||
|
|||||||
@@ -0,0 +1,45 @@
|
|||||||
|
name: qwen38-flash-rtx6000d
|
||||||
|
services:
|
||||||
|
vllm:
|
||||||
|
image: local/qwen38-flash-6000d:0bfc7a15
|
||||||
|
build: .
|
||||||
|
container_name: qwen38-flash-6000d
|
||||||
|
gpus: all
|
||||||
|
shm_size: 8g
|
||||||
|
mem_limit: 210g
|
||||||
|
memswap_limit: 210g
|
||||||
|
restart: unless-stopped
|
||||||
|
ports:
|
||||||
|
- "${BIND_ADDRESS:-127.0.0.1}:${API_PORT:-8000}:8000"
|
||||||
|
environment:
|
||||||
|
HF_HUB_OFFLINE: "1"
|
||||||
|
VLLM_USE_V2_MODEL_RUNNER: "1"
|
||||||
|
VLLM_WORKER_MULTIPROC_METHOD: spawn
|
||||||
|
OMP_NUM_THREADS: "8"
|
||||||
|
TORCHINDUCTOR_COMPILE_THREADS: "2"
|
||||||
|
CUTE_DSL_ARCH: sm_120a
|
||||||
|
volumes:
|
||||||
|
- /data/flash-next/models/nvidia-Qwen3.8-Flash-Next-NVFP4:/model:ro
|
||||||
|
- /data/flash-next/cache:/root/.cache
|
||||||
|
- ./secrets/api-key:/run/secrets/api-key:ro
|
||||||
|
entrypoint: ["/bin/bash", "-lc"]
|
||||||
|
command:
|
||||||
|
- >-
|
||||||
|
exec vllm serve /model
|
||||||
|
--served-model-name qwen3.8-flash-next
|
||||||
|
--host 0.0.0.0 --port 8000
|
||||||
|
--tensor-parallel-size 1 --dtype bfloat16
|
||||||
|
--engram-config '{"cpu_offload":true}'
|
||||||
|
--kv-cache-dtype fp8 --gpu-memory-utilization 0.96
|
||||||
|
--max-model-len 131072 --max-num-seqs 1 --max-num-batched-tokens 2048
|
||||||
|
--enable-chunked-prefill --enable-prefix-caching
|
||||||
|
--compilation-config '{"mode":0,"cudagraph_mode":"FULL","cudagraph_capture_sizes":[1]}' --no-enable-flashinfer-autotune
|
||||||
|
--load-format safetensors
|
||||||
|
--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
|
||||||
|
--api-key "$$(cat /run/secrets/api-key)"
|
||||||
|
healthcheck:
|
||||||
|
test: ["CMD", "python3", "-c", "import urllib.request; urllib.request.urlopen('http://127.0.0.1:8000/health', timeout=5)"]
|
||||||
|
interval: 30s
|
||||||
|
timeout: 10s
|
||||||
|
retries: 5
|
||||||
|
start_period: 30m
|
||||||
+3
-2
@@ -30,10 +30,11 @@ services:
|
|||||||
--host 0.0.0.0 --port 8000
|
--host 0.0.0.0 --port 8000
|
||||||
--tensor-parallel-size 1 --dtype bfloat16
|
--tensor-parallel-size 1 --dtype bfloat16
|
||||||
--engram-config '{"cpu_offload":true}'
|
--engram-config '{"cpu_offload":true}'
|
||||||
--kv-cache-dtype fp8 --gpu-memory-utilization 0.96
|
--kv-cache-dtype fp8 --gpu-memory-utilization 0.985
|
||||||
--max-model-len 131072 --max-num-seqs 1 --max-num-batched-tokens 2048
|
--max-model-len 131072 --max-num-seqs 1 --max-num-batched-tokens 2048
|
||||||
--enable-chunked-prefill --enable-prefix-caching
|
--enable-chunked-prefill --enable-prefix-caching
|
||||||
--compilation-config '{"mode":0,"cudagraph_mode":"FULL","cudagraph_capture_sizes":[1]}' --no-enable-flashinfer-autotune
|
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
|
||||||
|
--compilation-config '{"mode":0,"cudagraph_mode":"FULL","cudagraph_capture_sizes":[1,3]}' --no-enable-flashinfer-autotune
|
||||||
--load-format safetensors
|
--load-format safetensors
|
||||||
--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
|
--reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice
|
||||||
--api-key "$$(cat /run/secrets/api-key)"
|
--api-key "$$(cat /run/secrets/api-key)"
|
||||||
|
|||||||
@@ -1,5 +1,7 @@
|
|||||||
# 部署心得与后续优化
|
# 部署心得与后续优化
|
||||||
|
|
||||||
|
> 后续状态:已完成扩展 MTP 验证并启用 MTP 2;本文保留当时记录,当前结论见 [完整验证](mtp-qualification.md)。
|
||||||
|
|
||||||
记录日期:2026-09-18。结论对应本仓库固定的镜像、模型和实测,不自动适用于后续 nightly。
|
记录日期:2026-09-18。结论对应本仓库固定的镜像、模型和实测,不自动适用于后续 nightly。
|
||||||
|
|
||||||
## 先核对硬件,再计算预算
|
## 先核对硬件,再计算预算
|
||||||
|
|||||||
@@ -0,0 +1,99 @@
|
|||||||
|
# MTP 配对验证计划与结果
|
||||||
|
|
||||||
|
2026-09-18,延续 `06bcbcf` 基线。目标是评估 MTP 2 是否值得替换默认配置。不会把一次短输出计时等同于稳定性验收。
|
||||||
|
|
||||||
|
## 预设测试范围
|
||||||
|
|
||||||
|
- 无 MTP:128K、FP8 KV、Graph、GPU budget 0.96。
|
||||||
|
- MTP 2:同样的镜像、权重、上下文、视觉编码器与单活动请求,GPU budget 0.985;Graph 包含 3-token 验证形状。
|
||||||
|
- 两组使用同一脚本和生成资产、相同 seed 和采样参数;不会把精确逐字一致作为浮点路径变化后的唯一正确性标准。
|
||||||
|
- 12 道可精确验算的算术、精确 JSON、多轮记忆、OCR 发票与加总、4 张图片、120 秒 720p 视频顺序识别。
|
||||||
|
- 代码、中文需求、算法推理三类提示:每类一次预热、三次 2048-token 固定输出计时,xhigh 思考档;另有一次 16384-token 连续输出。
|
||||||
|
- 接近 128K 的两个位置检索,重复三次;长文本与图片混合检索;4 个客户端同时提交,验证单活动序列下的排队,不声称 GPU 并行处理。
|
||||||
|
- 两组各连续 600 秒混合负载,交替长输入、图像、视频、2048-token 解码,累计时间不包括前述功能与性能用例。
|
||||||
|
- 同时采集主机/GPU 资源、OOM、服务错误;功能失败和 HTTP 错误均保留,不能过滤失败后只汇报成功数据。
|
||||||
|
|
||||||
|
## 判定原则
|
||||||
|
|
||||||
|
默认启用必须满足:全部预设功能检查通过、无 OOM 或服务退出、长输出无中断、排队请求成功,并在多类长输出任务上有持续收益。单一 synthetic 测试不代表综合模型质量;真实业务长期运行和更大视频仍超出这次验证范围。
|
||||||
|
|
||||||
|
固定 token 计时使用 ignore_eos,可能得到截断或后续重复文本,只评估持续解码而非答案质量。精确答案用例正常使用 EOS。视频资产为六个颜色区间,每区间 20 秒,2fps、总计 240 帧;服务内部可能进一步采样。多模态能力是模型/处理器的实际输入路径测试,不代表任意时长、分辨率或帧数都可接受。
|
||||||
|
|
||||||
|
补充正常 EOS 任务:发票提取、订单去重、依赖调度、中文审批规则、合并区间和二分查找代码、工具调用参数。代码先做 AST 限制,再在独立进程中以 CPU/内存/时间上限执行固定测试用例,不执行任何外部工具操作。
|
||||||
|
|
||||||
|
预检曾使用不支持的 reasoning_effort=high,服务返回 400。查明支持 low/medium/xhigh 后改为 xhigh,两组统一使用修正脚本;原始预检错误单独保留,不混入正式统计。
|
||||||
|
|
||||||
|
状态:完整配对验证完成,MTP 2 已启用;原始记录保存在 `audit/qualification/`。
|
||||||
|
|
||||||
|
## 暂停后恢复与基线诊断
|
||||||
|
|
||||||
|
按用户要求暂停后,服务器恢复了无 MTP 配置。原基线正式套件 92 个请求全部通过,其中持续混合负载 54 个请求、623.7 秒;补充 xhigh 正常 EOS 任务有一道 merge-intervals 未返回正文。
|
||||||
|
|
||||||
|
原脚本在 JSON 解析失败时没有保存完整响应,已修正记录并保留原始失败。相同基线单项复测确认:finish_reason=length,8192 个输出 token 全部为 reasoning_tokens,content=null。没有证据将其归因于 MTP,因为该请求在无 MTP 下运行。相同任务在 medium 下生成代码并通过固定测试。
|
||||||
|
|
||||||
|
两种配置都补充相同的 medium 全套质量任务。高思考档的预算耗尽按实际失败记录;最终评价同时区分基础模型/输出预算限制和 MTP 相对基线的新回归,不用切换思考档的成功掩盖 xhigh 失败。
|
||||||
|
|
||||||
|
## 最终结果
|
||||||
|
|
||||||
|
| 检查 | 无 MTP | MTP 2 |
|
||||||
|
|---|---:|---:|
|
||||||
|
| 功能、计时、长输入及持续负载请求 | 92/92 通过 | 98/98 通过 |
|
||||||
|
| 其中连续混合负载 | 54 请求 / 623.7 秒 | 60 请求 / 614.0 秒 |
|
||||||
|
| xhigh 正常 EOS 任务 | 6/7 | 7/7 |
|
||||||
|
| medium 正常 EOS 任务 | 7/7 | 7/7 |
|
||||||
|
| 2048-token 代码提示,中位数 | 77.10 token/s | 123.42 token/s |
|
||||||
|
| 2048-token 中文提示,中位数 | 77.12 token/s | 128.78 token/s |
|
||||||
|
| 2048-token 推理提示,中位数 | 77.14 token/s | 122.15 token/s |
|
||||||
|
| 16384-token 单次持续输出 | 76.62 token/s,213.9 秒 | 142.32 token/s,115.2 秒 |
|
||||||
|
|
||||||
|
三类 2048-token 测试提升 **58%–67%**。16384-token 计时约提升 86%,但基线含 12136 个思考 token、MTP 为 16384 个思考 token,生成内容明显不同;只证明长时间解码速度和不中断,不能声称答案质量等价或完成业务更快。中文计时中两组思考/正文占比也不同。每类计时为预热后 3 次,不能外推到所有输入。
|
||||||
|
|
||||||
|
两组都通过:2048×1536 合成发票图片 OCR/加总、4 图输入、120 秒 720p 视频顺序识别、125995 token 双位置检索、111670 token 长文本加图片检索、4 客户端排队。两道生成代码在独立受限进程中通过固定用例;没有执行实际外部工具动作。
|
||||||
|
|
||||||
|
合计 1305 次资源采样:主机可用内存最低 171.95 GiB,OOM kill 最大值 0,未触发内存保护;GPU 峰值 84797 MiB / 85651 MiB,剩余约 854 MiB,温度峰值 64°C。当前容器 healthy、OOMKilled=false、restart=unless-stopped。这些为本次快照,不代表未来实时状态。
|
||||||
|
|
||||||
|
## 延迟与缓存取舍
|
||||||
|
|
||||||
|
MTP 减少可用 KV 容量,不能把解码收益直接换算成整体业务收益。本次持续负载中:
|
||||||
|
|
||||||
|
| 请求类别总耗时中位数 | 无 MTP | MTP 2 |
|
||||||
|
|---|---:|---:|
|
||||||
|
| 重复长输入检索 | 1.74 秒 | 15.17 秒 |
|
||||||
|
| 视频 | 2.08 秒 | 2.37 秒 |
|
||||||
|
| 图片 | 2.03 秒 | 1.31 秒 |
|
||||||
|
| 2048-token 解码 | 26.62 秒 | 16.70 秒 |
|
||||||
|
|
||||||
|
交替负载中的缓存状态不同。这是当前两套配置的实际混合负载表现,不能把长输入差异解读为纯计算预填充性能差异,也没有通过内核剖析证明具体缓存淘汰原因。初始基线重跑还可能复用之前预检的缓存,因此首次检索 TTFT 不作为冷启动预填充对照。独立的连续前缀复用检查两组均通过。
|
||||||
|
|
||||||
|
10 分钟内 MTP 处理 60 个混合请求、基线 54 个,说明本组混合任务的整体改善远小于解码提升。若主要业务是大段上下文反复提问、只生成很短的答案,原配置可能更合适。
|
||||||
|
|
||||||
|
## 当前采用与运行边界
|
||||||
|
|
||||||
|
按用户希望利用 MTP 提升生成速度的方向,服务器已采用 **MTP 2 + 128K + FP8 KV + 单活动请求 + 0.985 GPU 预算**,保留文字、图片、视频能力。启用自动重启;未提高并发或进一步挤占显存。没有声称通过全天运行或任意媒体大小测试。
|
||||||
|
|
||||||
|
完整测试未发现 MTP 新增的服务错误或所选任务正确性回归,因此本轮不再仅因显存余量较小就拒绝启用。仍需尊重实测边界:视觉检查为合成图/视频,代码为固定用例,10 分钟持续负载不是 24 小时压力测试,也不是通用模型质量认证。
|
||||||
|
|
||||||
|
日常代码和结构化任务建议显式指定 `reasoning_effort: medium`,并为最终正文预留输出预算;需要 xhigh 时检查 finish_reason,不能把 reasoning-only 的 length 响应当成完整答案。128K 是输入、思考和正文合计上限。
|
||||||
|
|
||||||
|
原无 MTP 配置保存在根目录 `compose.baseline.yaml`。服务器项目目录中执行以下命令可切换(会重启模型):
|
||||||
|
|
||||||
|
```bash
|
||||||
|
# 回退到无 MTP
|
||||||
|
docker compose -f compose.baseline.yaml up -d
|
||||||
|
# 恢复经本轮验证的 MTP 默认配置
|
||||||
|
docker compose -f compose.yaml up -d
|
||||||
|
```
|
||||||
|
|
||||||
|
## 复测方法
|
||||||
|
|
||||||
|
先用镜像内已有 Pillow/OpenCV/numpy 生成合成资产:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
docker cp scripts/make_qualification_assets.py qwen38-flash-6000d:/tmp/make_qualification_assets.py
|
||||||
|
docker exec qwen38-flash-6000d python3 /tmp/make_qualification_assets.py --output /root/.cache/qualification
|
||||||
|
python3 scripts/qualification.py --output /data/flash-next/audit/new-qualification.jsonl --soak-seconds 600
|
||||||
|
python3 scripts/quality_tasks.py --output /data/flash-next/audit/new-quality-xhigh.jsonl
|
||||||
|
python3 scripts/quality_tasks.py --effort medium --output /data/flash-next/audit/new-quality-medium.jsonl
|
||||||
|
```
|
||||||
|
|
||||||
|
输出路径必须不存在,避免覆盖原始记录。使用相同输入和设置配对比较,分别保留失败与成功结果。汇总工具 `scripts/summarize_qualification.py` 可读取与本次相同命名的回执目录。
|
||||||
@@ -1,5 +1,7 @@
|
|||||||
# MTP 实机测试
|
# MTP 实机测试
|
||||||
|
|
||||||
|
> 后续状态:已完成扩展 MTP 验证并启用 MTP 2;本文保留当时记录,当前结论见 [完整验证](mtp-qualification.md)。
|
||||||
|
|
||||||
日期:2026-09-18。初始对照:main `7e53821`,128K + FP8 KV + FULL CUDA Graph,无 MTP。
|
日期:2026-09-18。初始对照:main `7e53821`,128K + FP8 KV + FULL CUDA Graph,无 MTP。
|
||||||
|
|
||||||
## 方案
|
## 方案
|
||||||
|
|||||||
@@ -0,0 +1,16 @@
|
|||||||
|
"""Generate nonprivate OCR image and 120-second video; requires Pillow/OpenCV/numpy."""
|
||||||
|
from pathlib import Path
|
||||||
|
import argparse
|
||||||
|
import cv2,numpy as np
|
||||||
|
from PIL import Image,ImageDraw,ImageFont
|
||||||
|
parser=argparse.ArgumentParser();parser.add_argument('--output',type=Path,default=Path('/data/flash-next/cache/qualification'));p=parser.parse_args().output;p.mkdir(parents=True,exist_ok=True)
|
||||||
|
im=Image.new('RGB',(2048,1536),'white');draw=ImageDraw.Draw(im)
|
||||||
|
font=ImageFont.truetype('/usr/share/fonts/truetype/dejavu/DejaVuSans.ttf',72)
|
||||||
|
for i,s in enumerate(['INVOICE','Verification: SPARK-82741','Amount A: 125','Amount B: 478','Amount C: 765']):draw.text((100,120+i*220),s,font=font,fill='black')
|
||||||
|
im.save(p/'chart.png')
|
||||||
|
w=cv2.VideoWriter(str(p/'sequence120.mp4'),cv2.VideoWriter_fourcc(*'mp4v'),2,(1280,720))
|
||||||
|
assert w.isOpened()
|
||||||
|
for name,color in [('RED',(0,0,255)),('GREEN',(0,255,0)),('BLUE',(255,0,0)),('YELLOW',(0,255,255)),('PURPLE',(128,0,128)),('WHITE',(255,255,255))]:
|
||||||
|
for n in range(40):
|
||||||
|
frame=np.full((720,1280,3),color,dtype=np.uint8);cv2.putText(frame,name,(300,400),cv2.FONT_HERSHEY_SIMPLEX,3,(0,0,0),7);w.write(frame)
|
||||||
|
w.release();print('Assets generated',[(f.name,f.stat().st_size) for f in p.iterdir()])
|
||||||
@@ -0,0 +1,98 @@
|
|||||||
|
"""Paired API qualification. Run identically on baseline and MTP; synthetic data only."""
|
||||||
|
import argparse,base64,concurrent.futures,hashlib,json,random,time,urllib.request
|
||||||
|
from pathlib import Path
|
||||||
|
p=argparse.ArgumentParser();p.add_argument('--output',type=Path,required=True);p.add_argument('--soak-seconds',type=int,default=600);p.add_argument('--assets',type=Path,default=Path('/data/flash-next/cache/qualification'));a=p.parse_args()
|
||||||
|
key=(Path(__file__).resolve().parents[1]/'secrets/api-key').read_text().strip();url='http://127.0.0.1:8000';model='qwen3.8-flash-next'
|
||||||
|
def req(path,body=None):
|
||||||
|
return urllib.request.urlopen(urllib.request.Request(url+path,data=None if body is None else json.dumps(body).encode(),headers={'Authorization':'Bearer '+key,'Content-Type':'application/json'}),timeout=1200)
|
||||||
|
def run(name,messages,limit=4096,expected=None,forced=False,effort='low',extra=None):
|
||||||
|
body=dict(model=model,messages=messages,temperature=0,seed=6000,max_tokens=limit,reasoning_effort=effort,stream=True,stream_options={'include_usage':True});body.update(extra or {})
|
||||||
|
if forced:body['ignore_eos']=True
|
||||||
|
start=time.monotonic();first=None;content='';reasoning='';finish=None;usage={};events=0;max_gap=0;prev=None
|
||||||
|
try:
|
||||||
|
with req('/v1/chat/completions',body) as resp:
|
||||||
|
for raw in resp:
|
||||||
|
if not raw.startswith(b'data: '):continue
|
||||||
|
data=raw[6:].strip()
|
||||||
|
if data==b'[DONE]':break
|
||||||
|
x=json.loads(data)
|
||||||
|
if x.get('error'):raise RuntimeError(str(x['error']))
|
||||||
|
usage=x.get('usage') or usage
|
||||||
|
for c in x.get('choices',[]):
|
||||||
|
d=c.get('delta',{});s=d.get('content') or '';r=d.get('reasoning') or d.get('reasoning_content') or ''
|
||||||
|
if s or r:
|
||||||
|
now=time.monotonic();first=first or now;events+=1
|
||||||
|
if prev is not None:max_gap=max(max_gap,now-prev)
|
||||||
|
prev=now
|
||||||
|
content+=s;reasoning+=r;finish=c.get('finish_reason') or finish
|
||||||
|
end=time.monotonic();n=usage.get('completion_tokens',0)
|
||||||
|
passed=bool(first and n and finish)
|
||||||
|
if forced:passed=passed and n==limit and finish=='length'
|
||||||
|
elif expected is not None:
|
||||||
|
if isinstance(expected,list):passed=passed and all(str(v).lower() in content.lower() for v in expected) and finish=='stop'
|
||||||
|
else:passed=passed and content.strip()==expected and finish=='stop'
|
||||||
|
else:passed=passed and finish=='stop' and bool(content.strip())
|
||||||
|
return dict(name=name,passed=passed,finish=finish,usage=usage,ttft_s=None if first is None else first-start,elapsed_s=end-start,decode_tps=None if first is None else (n-1)/max(end-first,1e-6),max_stream_gap_s=max_gap,events=events,content=content,reasoning=reasoning,sha256=hashlib.sha256((content+reasoning).encode()).hexdigest())
|
||||||
|
except Exception as e:
|
||||||
|
detail=e.read().decode(errors='replace') if hasattr(e,'read') else str(e)
|
||||||
|
return dict(name=name,passed=False,error=detail,elapsed_s=time.monotonic()-start)
|
||||||
|
def text(s):return [{'role':'user','content':s}]
|
||||||
|
def media(kind,file):
|
||||||
|
mime='image/png' if kind=='image' else 'video/mp4';f=a.assets/file
|
||||||
|
return {'type':kind+'_url',kind+'_url':{'url':'data:'+mime+';base64,'+base64.b64encode(f.read_bytes()).decode()}}
|
||||||
|
image=media('image','chart.png');video=media('video','sequence120.mp4')
|
||||||
|
image_msgs=[{'role':'user','content':[{'type':'text','text':'Read the verification code and the three invoice amounts. Reply with the code and the sum of the amounts.'},image]}]
|
||||||
|
video_msgs=[{'role':'user','content':[{'type':'text','text':'List the six background colors in chronological order. Reply only with the English color names.'},video]}]
|
||||||
|
cases=[]
|
||||||
|
for i in range(12):
|
||||||
|
x=137+i*23;y=29+i*7
|
||||||
|
cases.append((f'arithmetic-{i}',text(f'Compute {x} * {y} + {i}. Reply only with the integer.'),2048,str(x*y+i)))
|
||||||
|
cases += [('json',text('Return ONLY valid JSON with exactly these values: {"name":"设备A","count":7,"enabled":true}. No markdown.'),2048,None),('multiturn',[{'role':'user','content':'Remember the code AQUA-58321.'},{'role':'assistant','content':'I will remember it.'},{'role':'user','content':'What was the code? Reply only with the code.'}],2048,'AQUA-58321'),('image-ocr',image_msgs,4096,['SPARK-82741','1368']),('video-120s',video_msgs,4096,['red','green','blue','yellow','purple','white']),('multi-image',[{'role':'user','content':[{'type':'text','text':'These four copies show the same invoice. What is its verification code? Reply only with the code.'},image,image,image,image]}],4096,'SPARK-82741')]
|
||||||
|
a.output.parent.mkdir(parents=True,exist_ok=True)
|
||||||
|
with a.output.open('x') as out:
|
||||||
|
def record(r):
|
||||||
|
out.write(json.dumps(r,ensure_ascii=False)+'\n');out.flush();print(json.dumps({k:v for k,v in r.items() if k not in ('content','reasoning')},ensure_ascii=False),flush=True)
|
||||||
|
def check(r):
|
||||||
|
if r['name']=='json' and r.get('passed'):
|
||||||
|
try:r['passed']=json.loads(r['content'])=={'name':'设备A','count':7,'enabled':True}
|
||||||
|
except Exception:r['passed']=False
|
||||||
|
if r['name'].startswith('video') and r.get('passed'):
|
||||||
|
indices=[r['content'].lower().find(c) for c in ['red','green','blue','yellow','purple','white']];r['passed']=indices==sorted(indices)
|
||||||
|
record(r)
|
||||||
|
for name,msgs,limit,expected in cases:check(run(name,msgs,limit,expected))
|
||||||
|
# Different useful workloads, fixed-length timing includes reasoning, not a quality score.
|
||||||
|
prompts=[('code','Write a production-quality Python CSV import utility with validation, duplicate handling, error reporting, unit tests, and a detailed explanation.'),('chinese','请写一份企业采购系统的完整需求说明,覆盖审批、预算、供应商、库存和审计,并逐项说明异常处理。'),('reasoning','Explain and prove why Dijkstra works with nonnegative weights. Include a counterexample with negative edges and compare Bellman-Ford.')]
|
||||||
|
for tag,prompt in prompts:
|
||||||
|
record(run('warmup-'+tag,text(prompt),256,forced=True,effort='xhigh'))
|
||||||
|
for i in range(3):record(run(f'perf-{tag}-{i}',text(prompt),2048,forced=True,effort='xhigh'))
|
||||||
|
record(run('long-output-16384',text('Write an extensive technical textbook chapter explaining algorithms, with many worked examples and Python implementations. Continue with additional examples throughout.'),16384,forced=True,effort='xhigh'))
|
||||||
|
# Exact token count, fresh random filler, two needles at separated positions.
|
||||||
|
rng=random.Random(927);lines=[f'Item {i:06d}: batch {rng.randrange(10**8):08d}, archived in shelf {rng.randrange(1000):03d}.\n' for i in range(16000)]
|
||||||
|
lines[20]='The northern access code is NORTH-49273.\n';lines[2500]='The southern access code is SOUTH-18362.\n'
|
||||||
|
question='\nGive both northern and southern access codes only.'
|
||||||
|
def longmsg(n):return text(''.join(lines[:n])+question)
|
||||||
|
lo,hi=2501,len(lines)
|
||||||
|
while lo<hi:
|
||||||
|
mid=(lo+hi+1)//2
|
||||||
|
with req('/tokenize',dict(model=model,messages=longmsg(mid),chat_template_kwargs={'reasoning_effort':'low'})) as resp:count=json.load(resp)['count']
|
||||||
|
if count<=126000:lo=mid
|
||||||
|
else:hi=mid-1
|
||||||
|
longmessages=longmsg(lo)
|
||||||
|
for i in range(3):record(run(f'long-context-{i}',longmessages,4096,['NORTH-49273','SOUTH-18362']))
|
||||||
|
# Smaller text budget leaves room for image tokens; request still exercises mixed long input.
|
||||||
|
mixed=[{'role':'user','content':[{'type':'text','text':''.join(lines[:max(2501,lo-600)])+'\nGive both access codes and the invoice verification code.'},image]}]
|
||||||
|
record(run('long-context-image',mixed,4096,['NORTH-49273','SOUTH-18362','SPARK-82741']))
|
||||||
|
# Queue pressure with max_num_seqs=1. This tests queued clients, not parallel GPU decoding.
|
||||||
|
with concurrent.futures.ThreadPoolExecutor(max_workers=4) as pool:
|
||||||
|
fs=[pool.submit(run,f'queued-{i}',text(f'Compute {43+i} * 17. Reply only with the integer.'),2048,str((43+i)*17)) for i in range(4)]
|
||||||
|
for f in concurrent.futures.as_completed(fs):record(f.result())
|
||||||
|
start=time.monotonic();i=0
|
||||||
|
while time.monotonic()-start<a.soak_seconds:
|
||||||
|
mode=i%5
|
||||||
|
if mode==0:r=run(f'soak-{i}-long',longmessages,4096,['NORTH-49273','SOUTH-18362'])
|
||||||
|
elif mode==1:r=run(f'soak-{i}-image',image_msgs,4096,['SPARK-82741','1368'])
|
||||||
|
elif mode==2:r=run(f'soak-{i}-video',video_msgs,4096,['red','green','blue','yellow','purple','white'])
|
||||||
|
else:r=run(f'soak-{i}-decode',text(prompts[i%3][1]+f'\nExample identifier: {i}.'),2048,forced=True,effort='xhigh')
|
||||||
|
record(r);i+=1
|
||||||
|
if 'error' in r:break
|
||||||
|
print('SUITE_COMPLETE',flush=True)
|
||||||
@@ -0,0 +1,54 @@
|
|||||||
|
"""Normal-EOS task checks: extraction, scheduling, tool arguments, and guarded code tests."""
|
||||||
|
import argparse,ast,json,subprocess,time,urllib.request
|
||||||
|
from pathlib import Path
|
||||||
|
p=argparse.ArgumentParser();p.add_argument('--output',type=Path,required=True);p.add_argument('--only');p.add_argument('--effort',default='xhigh',choices=['low','medium','xhigh']);p.add_argument('--max-tokens',type=int,default=8192);a=p.parse_args();key=(Path(__file__).resolve().parents[1]/'secrets/api-key').read_text().strip()
|
||||||
|
def call(messages,**extra):
|
||||||
|
body=dict(model='qwen3.8-flash-next',messages=messages,temperature=0,seed=6000,max_tokens=a.max_tokens,reasoning_effort=a.effort);body.update(extra)
|
||||||
|
req=urllib.request.Request('http://127.0.0.1:8000/v1/chat/completions',data=json.dumps(body).encode(),headers={'Authorization':'Bearer '+key,'Content-Type':'application/json'})
|
||||||
|
with urllib.request.urlopen(req,timeout=600) as r:return json.load(r)
|
||||||
|
# Only independently expected data; JSON parse accepts whitespace, not Markdown wrappers.
|
||||||
|
cases=[('invoice-extraction','Extract this invoice to JSON with keys supplier, currency, total, due_date: Supplier North Star Ltd; currency CNY; rows: 3 items at 125 each, 2 items at 48 each; shipping 20; discount 15. Due date 2026-10-03. total must be an integer. Reply only JSON.',{'supplier':'North Star Ltd','currency':'CNY','total':476,'due_date':'2026-10-03'}),('deduplicate','Input orders: A pending 12; B paid 20; A paid 15; C cancelled 99; D paid 8; B paid 25. Keep the last occurrence of each ID, discard cancelled orders, and output ONLY JSON {"ids":[...],"total":...}. Sort IDs alphabetically.',{'ids':['A','B','D'],'total':48}),('schedule','Jobs A takes 3 hours; B takes 5 hours after A; C takes 4 hours after A; D takes 2 hours after both B and C. Unlimited workers, start at hour 0. Output only JSON with earliest_finish and critical_path (array of job letters).',{'earliest_finish':10,'critical_path':['A','B','D']}),('chinese-policy','制度:金额不超过5000元由主管审批;超过5000且不超过20000由经理审批;超过20000由总监审批。加急不改变审批人。申请:甲5000,乙5001加急,丙20000,丁20001。请仅输出JSON,键为甲乙丙丁,值为主管/经理/总监。',{'甲':'主管','乙':'经理','丙':'经理','丁':'总监'})]
|
||||||
|
# No imports or arbitrary method calls permitted; child has CPU and address-space limits.
|
||||||
|
harness='''import ast,json,resource,sys
|
||||||
|
resource.setrlimit(resource.RLIMIT_CPU,(2,2));resource.setrlimit(resource.RLIMIT_AS,(256*1024**2,256*1024**2))
|
||||||
|
x=json.load(sys.stdin);tree=ast.parse(x['code'])
|
||||||
|
for n in ast.walk(tree):
|
||||||
|
if isinstance(n,(ast.Import,ast.ImportFrom,ast.ClassDef,ast.With,ast.AsyncWith,ast.Global,ast.Nonlocal)):raise ValueError('disallowed syntax')
|
||||||
|
if isinstance(n,ast.Name) and n.id.startswith('__'):raise ValueError('dunder name')
|
||||||
|
if isinstance(n,ast.Attribute) and n.attr not in ('append','sort','copy'):raise ValueError('disallowed attribute')
|
||||||
|
if isinstance(n,ast.Call):
|
||||||
|
if isinstance(n.func,ast.Name) and n.func.id not in ('sorted','len','range','min','max','list','enumerate','sum'):raise ValueError('disallowed call')
|
||||||
|
if not isinstance(n.func,(ast.Name,ast.Attribute)):raise ValueError('indirect call')
|
||||||
|
if isinstance(n,ast.FunctionDef) and (n.decorator_list or n.returns or any(z.annotation for z in n.args.args)):raise ValueError('annotations/decorators unsupported')
|
||||||
|
if any(not isinstance(n,ast.FunctionDef) for n in tree.body):raise ValueError('functions only')
|
||||||
|
g={'__builtins__':{k:__builtins__.__dict__[k] for k in ['sorted','len','range','min','max','list','enumerate','sum']}}
|
||||||
|
exec(compile(tree,'candidate','exec'),g)
|
||||||
|
for args,expected in x['tests']:
|
||||||
|
result=g[x['function']](*args)
|
||||||
|
if result!=expected:raise ValueError('wrong result: '+repr(result))
|
||||||
|
print('passed')
|
||||||
|
'''
|
||||||
|
codecases=[('merge-intervals','merge_intervals','Merge overlapping integer intervals, including touching endpoints. Return sorted merged intervals as lists.',[[[[]],[]],[[[[1,3],[2,6],[8,10],[15,18]]],[[1,6],[8,10],[15,18]]],[[[[1,4],[4,5]]],[[1,5]]],[[[[5,7],[1,9],[2,3]]],[[1,9]]]]),('binary-search','lower_bound','Return the index of the first element >= target in a sorted list nums, or len(nums) if none. Parameters nums, target.',[[[[],3],0],[[[1,2,2,4],2],1],[[[1,2,2,4],3],3],[[[1,2,2,4],9],4],[[[1,2,2,4],0],0]])]
|
||||||
|
with a.output.open('x') as out:
|
||||||
|
def save(row):out.write(json.dumps(row,ensure_ascii=False)+'\n');out.flush();print(json.dumps({k:v for k,v in row.items() if k!='response'},ensure_ascii=False),flush=True)
|
||||||
|
for name,prompt,expected in cases:
|
||||||
|
if a.only and a.only!=name:continue
|
||||||
|
r=None
|
||||||
|
start=time.monotonic()
|
||||||
|
try:
|
||||||
|
r=call([{'role':'user','content':prompt}]);c=r['choices'][0];actual=json.loads(c['message']['content']);passed=actual==expected and c['finish_reason']=='stop';save(dict(name=name,passed=passed,elapsed_s=time.monotonic()-start,response=r))
|
||||||
|
except Exception as e:save(dict(name=name,passed=False,error=str(e),response=r))
|
||||||
|
for name,fn,task,tests in codecases:
|
||||||
|
if a.only and a.only!=name:continue
|
||||||
|
r=None
|
||||||
|
try:
|
||||||
|
r=call([{'role':'user','content':f'Write Python function {fn}. {task} Reply ONLY a JSON object with a code string. Use no imports, type annotations, decorators, top-level statements or helper functions. Allowed builtins: sorted,len,range,min,max,list,enumerate,sum. Allowed methods: append,sort,copy.'}]);c=r['choices'][0];code=json.loads(c['message']['content'])['code'];result=subprocess.run(['python3','-I','-c',harness],input=json.dumps(dict(code=code,function=fn,tests=tests)),capture_output=True,text=True,timeout=5);save(dict(name=name,passed=result.returncode==0 and c['finish_reason']=='stop',validation_stdout=result.stdout,validation_stderr=result.stderr,response=r))
|
||||||
|
except Exception as e:save(dict(name=name,passed=False,error=str(e),response=r))
|
||||||
|
tools=[dict(type='function',function=dict(name='create_ticket',description='Create a support ticket',parameters=dict(type='object',properties={'title':{'type':'string'},'priority':{'type':'string','enum':['low','normal','urgent']},'asset':{'type':'string'}},required=['title','priority','asset'])))]
|
||||||
|
r=None
|
||||||
|
try:
|
||||||
|
if a.only and a.only!='tool-arguments':
|
||||||
|
print('QUALITY_COMPLETE',flush=True);raise SystemExit(0)
|
||||||
|
r=call([{'role':'user','content':'Call create_ticket with title exactly GPU cooling failure, priority urgent, and asset exactly GPU-092.'}],tools=tools,tool_choice='auto');c=r['choices'][0];tc=c['message']['tool_calls'];passed=len(tc)==1 and tc[0]['function']['name']=='create_ticket' and json.loads(tc[0]['function']['arguments'])=={'title':'GPU cooling failure','priority':'urgent','asset':'GPU-092'};save(dict(name='tool-arguments',passed=passed,response=r))
|
||||||
|
except Exception as e:save(dict(name='tool-arguments',passed=False,error=str(e),response=r))
|
||||||
|
print('QUALITY_COMPLETE',flush=True)
|
||||||
@@ -0,0 +1,31 @@
|
|||||||
|
"""Summarize complete/partial receipts without dropping failures."""
|
||||||
|
import argparse,json,statistics
|
||||||
|
from pathlib import Path
|
||||||
|
p=argparse.ArgumentParser();p.add_argument('directory',type=Path);a=p.parse_args();result={}
|
||||||
|
for variant in ['baseline','mtp2']:
|
||||||
|
path=a.directory/(variant+'.jsonl')
|
||||||
|
if not path.exists():continue
|
||||||
|
rows=[json.loads(l) for l in path.read_text().splitlines() if l];summary={'requests':len(rows),'failures':[{'name':x['name'],'error':x.get('error'),'content':x.get('content')} for x in rows if not x['passed']],'timing':{}}
|
||||||
|
for tag in ['code','chinese','reasoning']:
|
||||||
|
samples=[r for r in rows if r['name'].startswith('perf-'+tag+'-') and r.get('decode_tps')]
|
||||||
|
if samples:summary['timing'][tag]={'samples':len(samples),'decode_tps_median':statistics.median(r['decode_tps'] for r in samples),'ttft_s_median':statistics.median(r['ttft_s'] for r in samples),'elapsed_s_median':statistics.median(r['elapsed_s'] for r in samples),'reasoning_tokens':[r['usage'].get('completion_tokens_details',{}).get('reasoning_tokens') for r in samples]}
|
||||||
|
soak=[r for r in rows if r['name'].startswith('soak-')];summary['soak']={'requests':len(soak),'sum_request_seconds':sum(r.get('elapsed_s',0) for r in soak),'failures':sum(not r['passed'] for r in soak)}
|
||||||
|
long=[r for r in rows if r['name']=='long-output-16384'];summary['long_output']=[{k:v for k,v in r.items() if k not in ('content','reasoning')} for r in long]
|
||||||
|
quality=a.directory/(variant+'-quality.jsonl')
|
||||||
|
if quality.exists():
|
||||||
|
q=[json.loads(l) for l in quality.read_text().splitlines()];summary['quality']={'tasks':len(q),'failures':[r['name'] for r in q if not r['passed']]}
|
||||||
|
result[variant]=summary
|
||||||
|
if all(v in result for v in ['baseline','mtp2']):
|
||||||
|
result['speedup']={k:result['mtp2']['timing'][k]['decode_tps_median']/v['decode_tps_median'] for k,v in result['baseline']['timing'].items() if k in result['mtp2']['timing']}
|
||||||
|
for variant in ['baseline','mtp2']:
|
||||||
|
path=a.directory/(variant+'-quality-medium.jsonl')
|
||||||
|
if path.exists() and variant in result:
|
||||||
|
q=[json.loads(l) for l in path.read_text().splitlines()];result[variant]['quality_medium']={'tasks':len(q),'failures':[r['name'] for r in q if not r['passed']]}
|
||||||
|
rpath=a.directory/'resources.jsonl'
|
||||||
|
if rpath.exists():
|
||||||
|
rows=[json.loads(l) for f in [rpath,a.directory/'resources-resumed.jsonl'] if f.exists() for l in f.read_text().splitlines() if l];gpus=[]
|
||||||
|
for r in rows:
|
||||||
|
try:gpus.append([float(x.strip()) for x in r['gpu'].split(',')])
|
||||||
|
except (ValueError,KeyError):pass
|
||||||
|
result['resources']={'samples':len(rows),'min_host_available_gib':min(r['available_gib'] for r in rows),'oom_kill_max':max(r['oom_kill'] for r in rows),'safeguard_triggered':any(r['stop'] for r in rows),'gpu_memory_peak_mib':max((g[0] for g in gpus),default=None),'gpu_temperature_peak_c':max((g[3] for g in gpus),default=None)}
|
||||||
|
print(json.dumps(result,ensure_ascii=False,indent=2))
|
||||||
Reference in New Issue
Block a user