Skip to content

FreeToken ROCm Watch — notification channel - #1

Draft
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log
Draft

FreeToken ROCm Watch — notification channel#1
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log

Conversation

@Castoff995

Copy link
Copy Markdown
Owner

Этот PR служит постоянным каналом уведомлений для автоматической проверки GitHub каждые 2 часа. Его не нужно ревьюить, мержить или закрывать, пока слежка нужна.

Высший приоритет

Рабочие форки

  • PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf.
  • Maxritz/FreeToken-rocm-test:main.

Зависимости

  • ROCm/TheRock — Windows/RDNA4/gfx1201 wheels, PyTorch/HIP regressions and releases.
  • triton-lang/triton-windows — Windows AMD/HIP support and releases.
  • apache/tvm-ffi — Windows/HIP JIT and cache/toolchain changes.

Устойчивость модели

Также отслеживаются изменения, способные повлиять на первый токен и практический перевод: Qwen3.6/NVFP4, MoE offload, hybrid_radix, pinned/pageable residency, mapped device pointers, long-prefill/KV-cache hangs and engine crashes.

Уведомление публикуется только при существенном изменении: новый релевантный issue/PR, новый commit в ключевом PR/форке, изменение draft/merge/CI/state, новый релиз либо подтверждённый gfx1201/Windows результат. При отсутствии новостей комментариев не будет.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch запущен. Проверка выполняется каждые 2 часа; при отсутствии существенных изменений комментариев не будет.

Текущий P0 baseline:

Ключевые issues: FreeToken Roadmap (2026), ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please, Native Windows is classified as pin-uncapped, so #112's per-layer residency never auto-engages, Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp.

Дополнительно отслеживаются fork commits, ROCm/TheRock, Triton Windows, TVM-FFI, PyTorch gfx1201, Qwen3.6/NVFP4, mapped host pointers, pin-budget, long-prefill и offload stability.

@github-actions

github-actions Bot commented Aug 24, 2026

Copy link
Copy Markdown

{"branches":{"FlashML-org/FreeToken:main":{"branch":"main","date":"2026-09-02T02:43:19Z","message":"fix(hf): download the shards the safetensors index names (FlashML-org#336)","repo":"FlashML-org/FreeToken","sha":"a80b4d308a81986fa086ec173d7faa70ba737b2d","url":"FlashML-org@a80b4d308a81986fa086ec173d7faa70ba737b2d"},"Maxritz/FreeToken-rocm-test:main":{"branch":"main","date":"2026-08-26T08:26:56Z","message":"Merge pull request Maxritz#2 from PialGhosh2233/main","repo":"Maxritz/FreeToken-rocm-test","sha":"89f14790de7bbc69dd61a999ee76b86ba8316f26","url":"Maxritz@89f14790de7bbc69dd61a999ee76b86ba8316f26"},"PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf":{"branch":"gfx1200-moe-gguf","date":"2026-08-26T07:51:22Z","message":"docs: Gemma-4-26B-A4B QAT q4_0 GGUF results on gfx1200","repo":"PialGhosh2233/FreeToken-rocm-gfx1200","sha":"a338f49b93e2f098eeb3aa83423c9c5386c53ac4","url":"PialGhosh2233@a338f49b93e2f098eeb3aa83423c9c5386c53ac4"}},"discovered":{"FlashML-org/FreeToken#103%22:%7B%22body_hash%22:%225cc83924c09bfe42%22,%22comments%22:3,%22kind%22:%22pr%22,%22number%22:103,%22repo%22:%22FlashML-org/FreeToken%22,%22state%22:%22closed%22,%22title%22:%22feat(kvcache): 8-bit KV cache (q8_0 / fp8_e4m3) behind --kv-cache-dtype","updated_at":"2026-08-30T16:04:58Z","url":"https://github.com/FlashML-org/FreeToken/pull/103"},"FlashML-org/FreeToken#104":{"body_hash":"0ba9970c69c92be9","comments":12,"kind":"pr","number":104,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(models): support TP for qwen3_5_moe","updated_at":"2026-09-02T02:29:00Z","url":"https://github.com/FlashML-org/FreeToken/pull/104"},"FlashML-org/FreeToken#164":{"body_hash":"86f6c0cd6dee9851","comments":1,"kind":"issue","number":164,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.5 MoE modelopt_mixed loader assumes shared experts use routed-expert NVFP4 quantization","updated_at":"2026-08-30T18:59:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/164"},"FlashML-org/FreeToken#208":{"body_hash":"86da2a39c01e2f6d","comments":3,"kind":"pr","number":208,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen3_5_moe: support unsloth/Qwen3.8-27B-NVFP4 (mixed-precision NVFP4+FP8)","updated_at":"2026-09-01T14:54:55Z","url":"https://github.com/FlashML-org/FreeToken/pull/208"},"FlashML-org/FreeToken#217":{"body_hash":"0e0dbaaf50222ee4","comments":3,"kind":"pr","number":217,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(rocm): AMD ROCm support (gfx1100) + Qwen3.5-MoE GGUF loader","updated_at":"2026-09-02T04:27:57Z","url":"https://github.com/FlashML-org/FreeToken/pull/217"},"FlashML-org/FreeToken#227":{"body_hash":"ec213ea17037ea8c","comments":12,"kind":"issue","number":227,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug]: RuntimeError: Rowwise scaling is not currently supported on your device","updated_at":"2026-09-01T23:59:58Z","url":"https://github.com/FlashML-org/FreeToken/issues/227"},"FlashML-org/FreeToken#238":{"body_hash":"44be9d09584ba9be","comments":2,"kind":"issue","number":238,"repo":"FlashML-org/FreeToken","state":"open","title":"[BUG] qwen3_5 dense: mixed-precision NVFP4 crashes in ct_bf16_fuse (Float8 × BFloat16 promotion)","updated_at":"2026-09-01T11:15:04Z","url":"https://github.com/FlashML-org/FreeToken/issues/238"},"FlashML-org/FreeToken#24":{"body_hash":"04716372ce11a2b6","comments":1,"kind":"pr","number":24,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(cuda): support Turing GPUs","updated_at":"2026-08-30T15:46:40Z","url":"https://github.com/FlashML-org/FreeToken/pull/24"},"FlashML-org/FreeToken#248":{"body_hash":"89bb063d23656e84","comments":1,"kind":"issue","number":248,"repo":"FlashML-org/FreeToken","state":"open","title":"Two blocking bugs in Windows Desktop on consumer Blackwell (RTX 50): FP8 row-wise gate crash + Mistral tokenizer empty Chinese output","updated_at":"2026-08-31T02:20:59Z","url":"https://github.com/FlashML-org/FreeToken/issues/248"},"FlashML-org/FreeToken#260":{"body_hash":"cc73f05b77b626de","comments":5,"kind":"pr","number":260,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm: validate native gfx1151 serving on Strix Halo","updated_at":"2026-09-01T22:59:52Z","url":"https://github.com/FlashML-org/FreeToken/pull/260"},"FlashML-org/FreeToken#263":{"body_hash":"0892462f890d8743","comments":4,"kind":"issue","number":263,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug] ft checkpoint fails on Qwen3.6-35B-A3B abliterated NVFP4 checkpoints: Missing MoE expert source layers","updated_at":"2026-08-30T18:46:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/263"},"FlashML-org/FreeToken#268":{"body_hash":"90e395f1fec25670","comments":4,"kind":"pr","number":268,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): sub-byte Q4_0 and Q6_0 KV cache quantization","updated_at":"2026-09-01T05:39:25Z","url":"https://github.com/FlashML-org/FreeToken/pull/268"},"FlashML-org/FreeToken#272":{"body_hash":"5e9ec8faf54790cc","comments":1,"kind":"issue","number":272,"repo":"FlashML-org/FreeToken","state":"closed","title":"Feature Request: Support Image Input","updated_at":"2026-08-31T06:01:56Z","url":"https://github.com/FlashML-org/FreeToken/issues/272"},"FlashML-org/FreeToken#274":{"body_hash":"1534544dce8143a3","comments":2,"kind":"issue","number":274,"repo":"FlashML-org/FreeToken","state":"open","title":"FrontendAPI] ERROR Backend supervisor: KeyError: 'model.layers.0.mlp.shared_expert.gate_up_proj.weight_scale'","updated_at":"2026-08-30T19:17:08Z","url":"https://github.com/FlashML-org/FreeToken/issues/274"},"FlashML-org/FreeToken#275":{"body_hash":"2325c00fd601603b","comments":2,"kind":"pr","number":275,"repo":"FlashML-org/FreeToken","state":"open","title":"fix: [BUG] qwen3_5 dense: mixed-precision NVFP4 crashes in ct_bf16_fuse (Float8 × BFloat16 promotion)","updated_at":"2026-09-01T11:59:57Z","url":"https://github.com/FlashML-org/FreeToken/pull/275"},"FlashML-org/FreeToken#279":{"body_hash":"56c437aabe3b6485","comments":3,"kind":"pr","number":279,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(qwen4-exp): mmap PLE tables from disc","updated_at":"2026-09-01T17:19:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/279"},"FlashML-org/FreeToken#281":{"body_hash":"e31beec51d453c7e","comments":7,"kind":"issue","number":281,"repo":"FlashML-org/FreeToken","state":"open","title":"Proposal: reproducible end-to-end benchmark / regression harness","updated_at":"2026-09-02T03:54:28Z","url":"https://github.com/FlashML-org/FreeToken/issues/281"},"FlashML-org/FreeToken#283":{"body_hash":"c18348b1af14fce5","comments":1,"kind":"pr","number":283,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(models): load NVFP4 expert banks from checkpoints without a safetensors index","updated_at":"2026-09-02T02:46:59Z","url":"https://github.com/FlashML-org/FreeToken/pull/283"},"FlashML-org/FreeToken#288":{"body_hash":"44c341ac12601f0e","comments":2,"kind":"issue","number":288,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Bug] Windows + RTX 50 (sm_120): RuntimeError: Rowwise scaling is not currently supported on your device during CUDA graph capture — dense FP8 W8A8 path","updated_at":"2026-09-02T00:00:42Z","url":"https://github.com/FlashML-org/FreeToken/issues/288"},"FlashML-org/FreeToken#291":{"body_hash":"c9f6119e7760932e","comments":0,"kind":"issue","number":291,"repo":"FlashML-org/FreeToken","state":"open","title":"[WSL2] H2D copies from pinned memory silently no-op after heavy pinned-alloc churn (driver 591.86, CUDA 13.0 runtime)","updated_at":"2026-08-30T12:49:27Z","url":"https://github.com/FlashML-org/FreeToken/issues/291"},"FlashML-org/FreeToken#292":{"body_hash":"a6bd3d06b28d15df","comments":2,"kind":"pr","number":292,"repo":"FlashML-org/FreeToken","state":"open","title":"feat: support GLM-5.3-Flash NVFP4","updated_at":"2026-08-31T06:47:17Z","url":"https://github.com/FlashML-org/FreeToken/pull/292"},"FlashML-org/FreeToken#293":{"body_hash":"05c8c92e5c45231f","comments":1,"kind":"pr","number":293,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(qwen4_exp): fix nvfp4 ftw weight loading, qsa indexer, and ple tables","updated_at":"2026-08-31T02:09:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/293"},"FlashML-org/FreeToken#294":{"body_hash":"3a6dec8b0cbc36de","comments":1,"kind":"pr","number":294,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(qwen3_5_moe): detect shared-expert quant for modelopt mixed checkpoints","updated_at":"2026-09-01T08:32:59Z","url":"https://github.com/FlashML-org/FreeToken/pull/294"},"FlashML-org/FreeToken#296":{"body_hash":"e3a01040807ea2af","comments":1,"kind":"pr","number":296,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(qwen3_5_moe): support compressed-tensors NVFP4 experts with block-fp8 dense side","updated_at":"2026-09-01T08:33:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/296"},"FlashML-org/FreeToken#298":{"body_hash":"82f5c00b90b8d5d3","comments":0,"kind":"pr","number":298,"repo":"FlashML-org/FreeToken","state":"open","title":"Support poolside/Laguna-S-2.1-NVFP4, and fix serving from source on Windows","updated_at":"2026-08-30T20:25:02Z","url":"https://github.com/FlashML-org/FreeToken/pull/298"},"FlashML-org/FreeToken#299":{"body_hash":"59cf775ec5fee7c1","comments":0,"kind":"issue","number":299,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken-Intel: 35B MoE, live tokens off an Arc Pro B70 (SYCL / XPU port)","updated_at":"2026-09-01T23:55:22Z","url":"https://github.com/FlashML-org/FreeToken/issues/299"},"FlashML-org/FreeToken#300":{"body_hash":"b1273dfe00a571e9","comments":0,"kind":"pr","number":300,"repo":"FlashML-org/FreeToken","state":"open","title":"feat: Automatic KV/MoE Laddering for decode speed vs context-length trade off ( upto 33% faster decode )","updated_at":"2026-08-30T22:35:41Z","url":"https://github.com/FlashML-org/FreeToken/pull/300"},"FlashML-org/FreeToken#301":{"body_hash":"40475c88b787fc6e","comments":1,"kind":"issue","number":301,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): allow overriding the distributed port","updated_at":"2026-08-31T02:09:36Z","url":"https://github.com/FlashML-org/FreeToken/issues/301"},"FlashML-org/FreeToken#302":{"body_hash":"53ce92fba4ae82bc","comments":1,"kind":"issue","number":302,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): add a server-side thinking override","updated_at":"2026-08-31T02:09:37Z","url":"https://github.com/FlashML-org/FreeToken/issues/302"},"FlashML-org/FreeToken#303":{"body_hash":"987029c9a94f59f1","comments":0,"kind":"issue","number":303,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): account for attention workspace in cache-pool sizing","updated_at":"2026-08-30T23:02:07Z","url":"https://github.com/FlashML-org/FreeToken/issues/303"},"FlashML-org/FreeToken#304":{"body_hash":"6947af227ec8c861","comments":0,"kind":"issue","number":304,"repo":"FlashML-org/FreeToken","state":"open","title":"[Windows] Qwen3.6-35B-A3B-NVFP4 expert loading crashes — torch_cpu.dll access violation (0xc0000005)","updated_at":"2026-08-31T00:47:27Z","url":"https://github.com/FlashML-org/FreeToken/issues/304"},"FlashML-org/FreeToken#306":{"body_hash":"5f4417a782901609","comments":0,"kind":"issue","number":306,"repo":"FlashML-org/FreeToken","state":"open","title":"Long-context decode: client wall-clock is ~half the scheduler gen throughput","updated_at":"2026-08-31T03:09:53Z","url":"https://github.com/FlashML-org/FreeToken/issues/306"},"FlashML-org/FreeToken#307":{"body_hash":"0c7eb3672129dec5","comments":0,"kind":"issue","number":307,"repo":"FlashML-org/FreeToken","state":"open","title":"temperature 0 is not reproducible with thinking on (identical requests diverge on near-ties)","updated_at":"2026-08-31T03:09:53Z","url":"https://github.com/FlashML-org/FreeToken/issues/307"},"FlashML-org/FreeToken#308":{"body_hash":"257cd42bf835ad1d","comments":0,"kind":"issue","number":308,"repo":"FlashML-org/FreeToken","state":"open","title":"ft bench bw -o writes a profile that hybrid never loads (silent fetch cap of 1)","updated_at":"2026-08-31T03:09:54Z","url":"https://github.com/FlashML-org/FreeToken/issues/308"},"FlashML-org/FreeToken#311":{"body_hash":"05fb3389b262f3c4","comments":2,"kind":"pr","number":311,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(qwen4_exp): stream the PLE n-gram table from disk","updated_at":"2026-09-01T20:35:14Z","url":"https://github.com/FlashML-org/FreeToken/pull/311"},"FlashML-org/FreeToken#315":{"body_hash":"4bb9eb5f4d845e71","comments":0,"kind":"pr","number":315,"repo":"FlashML-org/FreeToken","state":"open","title":"Fix GGUF user-defined token atomicity","updated_at":"2026-08-31T19:08:05Z","url":"https://github.com/FlashML-org/FreeToken/pull/315"},"FlashML-org/FreeToken#316":{"body_hash":"97a5efc93019df65","comments":0,"kind":"pr","number":316,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(rocm): avoid indirect host pointers during HIP graph capture","updated_at":"2026-09-01T15:05:05Z","url":"https://github.com/FlashML-org/FreeToken/pull/316"},"FlashML-org/FreeToken#318":{"body_hash":"b288fbd200e414b8","comments":1,"kind":"issue","number":318,"repo":"FlashML-org/FreeToken","state":"open","title":"Design discussion: first-class out-of-tree model providers","updated_at":"2026-09-01T15:05:50Z","url":"https://github.com/FlashML-org/FreeToken/issues/318"},"FlashML-org/FreeToken#320":{"body_hash":"dc06711149928e6d","comments":0,"kind":"pr","number":320,"repo":"FlashML-org/FreeToken","state":"open","title":"qwen4_exp: load modelopt MIXED_PRECISION (NVFP4 experts + block-FP8 dense) checkpoints","updated_at":"2026-09-01T03:34:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/320"},"FlashML-org/FreeToken#324":{"body_hash":"644fad6946baa855","comments":2,"kind":"issue","number":324,"repo":"FlashML-org/FreeToken","state":"open","title":"[Showcase & Fix] Qwen3.8-Flash-Next on Dual RTX 5090 Blackwell + Tool Call Recovery Patch","updated_at":"2026-09-01T19:44:50Z","url":"https://github.com/FlashML-org/FreeToken/issues/324"},"FlashML-org/FreeToken#328":{"body_hash":"d74f7aedfdc8a045","comments":0,"kind":"issue","number":328,"repo":"FlashML-org/FreeToken","state":"open","title":"Can't load Qwen3.8-Flash-Next","updated_at":"2026-09-01T08:57:35Z","url":"https://github.com/FlashML-org/FreeToken/issues/328"},"FlashML-org/FreeToken#332":{"body_hash":"820355a82f7eb2c1","comments":0,"kind":"pr","number":332,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(glm5_next): support GLM-5.3-Flash","updated_at":"2026-09-01T22:18:16Z","url":"https://github.com/FlashML-org/FreeToken/pull/332"},"FlashML-org/FreeToken#335":{"body_hash":"42a24e63af908edf","comments":0,"kind":"issue","number":335,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug] b12x NVFP4 backend on sm_120 (RTX 5090) serves batch 1 only: not CUDA-graph capturable, and the worker dies with a tile-config ValueError at batch >= 2 (Qwen3.8-Flash-Next-NVFP4)","updated_at":"2026-09-01T23:08:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/335"},"FlashML-org/FreeToken#337":{"body_hash":"1b7d3c219882248c","comments":0,"kind":"pr","number":337,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(moe): NVMe disk tier for MoE expert banks","updated_at":"2026-09-02T03:52:50Z","url":"https://github.com/FlashML-org/FreeToken/pull/337"},"FlashML-org/FreeToken#338":{"body_hash":"2ea2d570a433b53e","comments":0,"kind":"pr","number":338,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(ple): fuse the n-gram row-id hash into one Triton kernel","updated_at":"2026-09-02T04:12:47Z","url":"https://github.com/FlashML-org/FreeToken/pull/338"},"FlashML-org/FreeToken#339":{"body_hash":"7d0f17426b165cb7","comments":0,"kind":"pr","number":339,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(kernels): drop the D2H sync from the varlen GDN/KDA prefill conv","updated_at":"2026-09-02T04:12:49Z","url":"https://github.com/FlashML-org/FreeToken/pull/339"},"FlashML-org/FreeToken#340":{"body_hash":"4c2febbad30c626f","comments":0,"kind":"pr","number":340,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): reserve the pool's dummy page in the --moe-cache-auto KV floor","updated_at":"2026-09-02T04:12:51Z","url":"https://github.com/FlashML-org/FreeToken/pull/340"},"FlashML-org/FreeToken#55":{"body_hash":"049b3cf948a4f89e","comments":0,"kind":"issue","number":55,"repo":"FlashML-org/FreeToken","state":"closed","title":"Windows/WDDM: offload serving fails when bank sources exceed the ~50%-RAM pageable-locking pool (repro, measurements, proposed path)","updated_at":"2026-08-31T06:50:04Z","url":"https://github.com/FlashML-org/FreeToken/issues/55"},"FlashML-org/FreeToken#60":{"body_hash":"9ff8ed296bc092d9","comments":17,"kind":"issue","number":60,"repo":"FlashML-org/FreeToken","state":"open","title":"Feature request: AMD GPU support","updated_at":"2026-09-01T23:13:18Z","url":"https://github.com/FlashML-org/FreeToken/issues/60"}},"errors":["dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 5400:168969:2614347:276478E:6A97A9F1 and timestamp 2026-09-02 04:45:37 UTC. For more on scraping GitHub and how it may affect your rights, please review our Terms of Service (https://docs.github.com/en/site-policy/github-terms/github-terms-of-service)"],"external_tracked_issues":{"ROCm/legacy-rocm-build#6461":{"body_hash":"0ac6e80ee9b489cd","comments":4,"kind":"issue","number":6461,"relevance":"high","relevance_reason":"Windows + gfx1201 + hipBLASLt/rocBLAS sequence/state-dependent GEMM failure","repo":"ROCm/legacy-rocm-build","state":"open","title":"[Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14","updated_at":"2026-08-25T10:25:55Z","url":"https://github.com/ROCm/legacy-rocm-build/issues/6461"}},"last_checked":"2026-09-02T04:45:03+00:00","releases":{"FlashML-org/FreeToken":{"draft":false,"name":"v0.1.2","prerelease":false,"published_at":"2026-08-19T06:20:18Z","tag":"v0.1.2","url":"https://github.com/FlashML-org/FreeToken/releases/tag/v0.1.2"},"ROCm/ROCm":{"draft":false,"name":"ROCm 7.14.0 Release","prerelease":false,"published_at":"2026-07-16T03:28:58Z","tag":"rocm-7.14.0","url":"https://github.com/ROCm/legacy-rocm-build/releases/tag/rocm-7.14.0"},"ROCm/TheRock":{"draft":false,"name":"","prerelease":false,"published_at":"2026-08-26T10:03:34Z","tag":"therock-10.0","url":"https://github.com/ROCm/TheRock/releases/tag/therock-10.0"},"apache/tvm-ffi":{"draft":false,"name":"v0.1.13-post3","prerelease":false,"published_at":"2026-08-10T13:31:09Z","tag":"v0.1.13-post3","url":"https://github.com/apache/tvm-ffi/releases/tag/v0.1.13-post3"},"ggml-org/llama.cpp":{"draft":false,"name":"v0.3.0","prerelease":false,"published_at":"2026-08-25T10:22:58Z","tag":"v0.3.0","url":"https://github.com/ggml-org/llama.cpp/releases/tag/v0.3.0"},"triton-lang/triton-windows":{"draft":false,"name":"v3.8.0-windows.post28","prerelease":false,"published_at":"2026-08-29T12:24:14Z","tag":"v3.8.0-windows.post28","url":"https://github.com/triton-lang/triton-windows/releases/tag/v3.8.0-windows.post28"}},"tracked_issues":{"110":{"body_hash":"d6672f16a90f2854","comments":1,"kind":"issue","number":110,"repo":"FlashML-org/FreeToken","state":"open","title":"Unhandled CUDA OOM in prefill expert workspace kills the engine; server keeps accepting requests that never return (root cause behind FlashML-org#20-style headless state; likely also FlashML-org#72)","updated_at":"2026-08-23T20:43:34Z","url":"https://github.com/FlashML-org/FreeToken/issues/110"},"111":{"body_hash":"b01b977d143435c7","comments":3,"kind":"issue","number":111,"repo":"FlashML-org/FreeToken","state":"open","title":"Requests longer than the KV pool are queued forever with no error — and --moe-cache-auto leaves only ~8k tokens of KV on a 96GB GPU","updated_at":"2026-08-31T02:09:35Z","url":"https://github.com/FlashML-org/FreeToken/issues/111"},"120":{"body_hash":"a7caa8c0bca18470","comments":1,"kind":"issue","number":120,"repo":"FlashML-org/FreeToken","state":"open","title":"Native Windows is classified as pin-uncapped, so FlashML-org#112's per-layer residency never auto-engages","updated_at":"2026-08-24T03:04:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/120"},"122":{"body_hash":"4d42515b782747ed","comments":6,"kind":"issue","number":122,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp","updated_at":"2026-08-27T07:18:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/122"},"123":{"body_hash":"09dd1b9b8cf6560f","comments":1,"kind":"issue","number":123,"repo":"FlashML-org/FreeToken","state":"closed","title":"Request hang (silent, zero-log) with hybrid_radix cache + moe-backend offload + nvfp4 triton backend — reproduced on 2 independent models, not explained by FlashML-org#110","updated_at":"2026-08-29T05:13:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/123"},"124":{"body_hash":"64a1de8500f135a3","comments":0,"kind":"issue","number":124,"repo":"FlashML-org/FreeToken","state":"closed","title":"NVFP4 checkpoints fail to load: model.safetensors.index.json is not downloaded, but the NVFP4 bank loader requires it","updated_at":"2026-09-02T02:43:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/124"},"79":{"body_hash":"2fe32010327776c6","comments":15,"kind":"issue","number":79,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken Roadmap (2026)","updated_at":"2026-09-01T23:28:49Z","url":"https://github.com/FlashML-org/FreeToken/issues/79"},"82":{"body_hash":"ff59a7ff00722b01","comments":16,"kind":"issue","number":82,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please","updated_at":"2026-08-28T14:46:41Z","url":"https://github.com/FlashML-org/FreeToken/issues/82"}},"tracked_prs":{"112":{"base_sha":"f0abe587a11cca53bb3c37a9596fad24973ace62","body_hash":"aa539235301fea3d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":3,"draft":false,"head_sha":"831d38a66bc45543411078c6805de8c42e7603fa","merged":true,"number":112,"review_comments":0,"state":"closed","title":"feat(moe): per-layer host-bank residency","updated_at":"2026-08-24T00:39:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/112"},"118":{"base_sha":"e0a3bbc04652ec0622d932adcbf2772848e3c2e2","body_hash":"d73a76c00cdb2f94","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"6241178a7550e5a0ffadd85f0eb04af0160f9988","merged":false,"number":118,"review_comments":0,"state":"open","title":"fix(scheduler): clamp admission to the actual KV pool so oversized prompts fail loudly","updated_at":"2026-08-24T00:52:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/118"},"125":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"793491958f083651","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"cb44bdeedb7ea6ed2b37c5c49864ad40065e1985","merged":false,"number":125,"review_comments":0,"state":"open","title":"test(pinned): use mapped memory for UVA pointer check","updated_at":"2026-08-24T05:48:44Z","url":"https://github.com/FlashML-org/FreeToken/pull/125"},"129":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"d5c4ac29d87557fc","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":1,"draft":false,"head_sha":"d30726e006b2708d4fbfead120985bc23c935541","merged":false,"number":129,"review_comments":0,"state":"closed","title":"fix(download): include json files when fetching weights, so NVFP4's index.json is no longer silently skipped","updated_at":"2026-09-02T02:45:39Z","url":"https://github.com/FlashML-org/FreeToken/pull/129"},"131":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"33bc52d171e8ca00","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":36,"draft":false,"head_sha":"bb432e8c473c557cdef6517abccf0c129bd8c544","merged":false,"number":131,"review_comments":0,"state":"open","title":"GGUF: support all quant types, add qwen35moe","updated_at":"2026-08-29T22:27:37Z","url":"https://github.com/FlashML-org/FreeToken/pull/131"},"132":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"f5b92547538a8571","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":9,"draft":false,"head_sha":"c0713e44eace3cacd02f27f13d0f6032f4bc86ae","merged":false,"number":132,"review_comments":0,"state":"open","title":"feat(rocm): add RDNA3 and RDNA4 runtime foundation","updated_at":"2026-09-01T05:20:37Z","url":"https://github.com/FlashML-org/FreeToken/pull/132"},"133":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"eb17018abe601f2c","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":11,"draft":true,"head_sha":"07a352a0ef5c37398f13ef893648dbbfd126f601","merged":false,"number":133,"review_comments":0,"state":"open","title":"fix(rocm): make TVM-FFI index and store JIT kernels portable to HIP","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/133"},"134":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"467c9a375cece285","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":11,"draft":true,"head_sha":"32dfb7bd123d935e256508fbc8c76bbaa9012226","merged":false,"number":134,"review_comments":0,"state":"open","title":"fix(rocm): gate CUDA-only optional backends on ROCm","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/134"},"135":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"3a0be6c359e61828","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":11,"draft":true,"head_sha":"b794aa50056ef3c7a567e02f4787cab3d5b750a9","merged":false,"number":135,"review_comments":0,"state":"open","title":"fix(rocm): route tensor parallel communication through RCCL","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/135"},"136":{"base_sha":"3a20a79038338c33bd051c52152e6d1faa4d9791","body_hash":"c875bbbd1cb60d21","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":13,"draft":true,"head_sha":"7b3acf2f3d3d321ba7127d65168f9882d2a5d76f","merged":false,"number":136,"review_comments":0,"state":"open","title":"feat(rocm): enable native GGUF kernels on ROCm (validated on RDNA4)","updated_at":"2026-08-31T08:13:20Z","url":"https://github.com/FlashML-org/FreeToken/pull/136"},"137":{"base_sha":"f7c31e92dbf296de3a5bb1b9c5fcb58f988e3a07","body_hash":"a0597a23e4607628","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"5eec2582ce89376e3f5016d47ff73ca1b4e8d445","merged":false,"number":137,"review_comments":0,"state":"open","title":"feat(rocm): serve on AMD GPUs through the HIP toolchain","updated_at":"2026-08-26T09:03:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/137"},"27":{"base_sha":"0ab982f10905fa775962a4eddcb44caa50065251","body_hash":"e85637efb5176c06","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":1,"draft":false,"head_sha":"d76d5e0105235e9f13edd534fec3dfa86f25cb15","merged":false,"number":27,"review_comments":0,"state":"closed","title":"feat(moe): partial-pin serving to beat the Windows/WSL2 pinned-memory quota (--pin-exempt-layers)","updated_at":"2026-08-24T01:28:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/27"}},"version":1}

Technical baseline updated automatically: 2026-09-02T04:45:03+00:00. This comment is edited in place and does not represent a notification.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T15:02:31+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T16:56:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T18:31:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T19:01:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T20:49:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T22:45:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T01:53:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T03:13:46+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T04:55:02+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T07:09:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T09:01:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T10:51:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T11:11:49+00:00).

  • Новый явно отслеживаемый external issue: [Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14. High relevance.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8024:3880E4:B12B:25494:6A8D788F and timestamp 2026-08-25 11:12:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T13:13:08+00:00).

  • feat(rocm): add RDNA3 and RDNA4 runtime foundation: обновлены описание/review/discussion (comments 1→2, review 0→0).
  • Новый релевантный issue: Feature: Predictive Expert Offloading.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID F440:3A3DE2:D8F1C6:2D7E43E:6A8D950E and timestamp 2026-08-25 13:13:50 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T15:07:11+00:00).

  • FreeToken Roadmap (2026): comments 5→6.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0407:272BC6:1AC4A9F:5964A5E:6A8DAFBB and timestamp 2026-08-25 15:07:39 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T16:57:34+00:00).

  • Model catalog shows models the local machine cannot run (no capability pre-check before display): обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 283F:2B3BAA:2009A4A:6A360EB:6A8DC9A1 and timestamp 2026-08-25 16:58:09 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T18:58:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T20:47:37+00:00).

  • fix(deps): use PyTorch 2.13 to fix SM89 hangs: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7830:16ACDE:3C41178:CA29304:6A8DFF87 and timestamp 2026-08-25 20:48:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T22:46:42+00:00).

  • GGUF: support all quant types, add qwen35moe: новый commit dd48aacb9952a39d.
  • Maxritz/FreeToken-rocm-test:main: 45675e473a5616ec — Merge pull request FreeToken ROCm Watch — notification channel #1 from Castoff995/codex/gfx1201-offload-decode.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID CC18:2EB04F:4D5504F:100358CF:6A8E1B72 and timestamp 2026-08-25 22:47:14 UT…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T01:59:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T03:19:34+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T04:57:21+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T07:10:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T09:04:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T10:52:44+00:00).

  • Новый релевантный pr: feat(models): add Qwen3-Next-80B-A3B support.
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 3→5).
  • Новый релиз: ROCm/TheRock therock-10.0.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B008:2BB36A:73A408:77B54F:6A8EC59E and timestamp 2026-08-26 10:53:18 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T13:18:13+00:00).

  • FreeToken Roadmap (2026): comments 6→7.
  • Feature request: AMD GPU support: обновлён (state open→open, comments 11→12).
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 5→7).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0400:15153F:A5D123:230714B:6A8EE7C0 and timestamp 2026-08-26 13:18:56 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T15:55:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T17:33:54+00:00).

  • FreeToken Roadmap (2026): comments 7→8.
  • Новый релевантный pr: feat(rocm): AMD ROCm support (gfx1100) + Qwen3.5-MoE GGUF loader.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 3C34:1A0AD0:3D5C1B3:CC983FC:6A8F239F and timestamp 2026-08-26 17:34:23 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T20:02:52+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T23:36:03+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-27T09:52:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-27T20:32:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-28T06:08:28+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-28T18:44:42+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-29T02:49:54+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-29T11:07:25+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-29T16:44:19+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-29T20:56:35+00:00).

  • Новый релевантный issue: Feature Request: opt-in FP8 KV-cache support for long-context MoE inference.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID A811:3CE456:2509012:7BC17A6:6A9347A3 and timestamp 2026-08-29 20:57:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-30T00:21:59+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-30T08:20:45+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-30T14:53:16+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-30T19:19:43+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-30T22:45:54+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-31T05:38:54+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-31T13:55:18+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-31T20:07:31+00:00).

  • Новый релевантный pr: Fix GGUF user-defined token atomicity.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8402:325C1D:2E8B7B:301D7C:6A95DF27 and timestamp 2026-08-31 20:08:07 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-31T23:52:25+00:00).

  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 10→11).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID C423:2547C8:185277F:50A0CA5:6A9613D3 and timestamp 2026-08-31 23:52:51 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-01T05:12:52+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-01T11:41:30+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-01T16:41:47+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-01T21:03:48+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-02T00:16:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Sep 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-02T04:45:03+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant