Skip to content

RuntimeError: flashinfer-cubin version (0.7.0) does not match flashinfer version (0.6.18.post1) #543

Description

@Lolmc0587

Before you start

  • I have read the FAQ and my problem is not answered there.
  • I have read the Roadmap and this is not already planned there.
  • I have searched existing issues and found no duplicate.
  • I am on the latest release, or on a freshly rebuilt main when building from source.

What happened

Can't run any models. Already delete old venv and start install again from Free Desktop app.

How did you install FreeToken

pip / uv wheel

FreeToken version

freetoken version 0.1.3+gcc1f5c2c9

OS

Arch Linux

OS details

No response

GPU and driver

RTX 5050 Laptop, 8gb VRAM

CPU and system RAM

i7-13650HX, 32GB Ram

Checkpoint

nvidia/Qwen3.6-35B-A3B-NVFP4

Command

Full log

[20:27:13] cmd/INFO  ft serve --model /home/lolmc/.freetoken/models/Qwen3.6-35B-A3B-NVFP4 --port 1919 --moe-backend hybrid --max-running-requests 4 --memory-ratio 0.88 --host 127.0.0.1 --cors-origins tauri://localhost,http://tauri.localhost,http://localhost:1420
[20:27:22] stdout/WARN  [2026-09-23|20:27:22] WARNING  --moe-backend is deprecated; use --moe-strategy
[20:27:22] stdout/INFO  [2026-09-23|20:27:22] INFO     Parsed arguments:
[20:27:22] stdout/INFO  ServerArgs(model_path='/home/lolmc/.freetoken/models/Qwen3.6-35B-A3B-NVFP4', tp_info=DistributedInfo(rank=0, size=1), dtype=torch.bfloat16, max_running_req=4, attention_backend='auto', moe_strategy='hybrid', quant_backend=None, ple_backend='disk', expert_load='auto', moe_cache_size=0, moe_cache_rate=None, moe_cache_auto=True, kv_reserve_tokens=8192, moe_cache_policy='lru', moe_prefill_overlap=True, moe_prefill_hit_d2d=False, moe_collect_stats=False, moe_cpu_threads=0, moe_cpu_layers=None, moe_hybrid_max_fetch=-1, cuda_graph_bs=None, cuda_graph_max_bs=None, page_size=1, memory_ratio=0.88, linear_state_cache_ratio=2.0, swa_full_tokens_ratio=0.2, swa_num_pages_override=None, distributed_timeout=60.0, use_dummy_weight=False, use_pynccl=True, max_seq_len_override=None, num_page_override=None, num_token_override=None, mm=MultimodalConfig(disabled_encoders=frozenset(), embed_cache_device='cpu', encoder_weights='host', image_min_tokens=None, image_max_tokens=None, processor_kwargs={}), max_extend_tokens=8192, cache_type='radix', offline_mode=False, decode_log_interval=40, special_token_ckpt=False, _unique_suffix='.pid=57188', server_host='127.0.0.1', server_port=1919, num_tokenizer=0, silent_output=False, shell_mode=False, served_model_name='Qwen3.6-35B-A3B-NVFP4', tool_call_parser='qwen3_coder', reasoning_parser='qwen3', sampling_defaults='model', max_output_tokens=None, enable_cache_report=False, allowed_media_domains='', allowed_local_media_path='', cors_origins='tauri://localhost,http://tauri.localhost,http://localhost:1420', gpu=(), gpu_assigned=None)
[20:27:22] stdout/INFO  [2026-09-23|20:27:22|FrontendAPI] INFO     Default sampling config (source=model): temperature=1.0, top_k=20, top_p=0.95
[20:27:22] stderr/INFO  INFO:     Started server process [57188]
[20:27:22] stderr/INFO  INFO:     Waiting for application startup.
[20:27:22] stderr/INFO  INFO:     Application startup complete.
[20:27:22] stderr/INFO  INFO:     Uvicorn running on http://127.0.0.1:1919 (Press CTRL+C to quit)
[20:27:24] stderr/INFO  /home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/engine/engine.py:1168: FutureWarning: torch.cuda._set_allocator_settings is deprecated. Use torch._C._accelerator_setAllocatorSettings instead.
[20:27:24] stderr/INFO    torch.cuda.memory._set_allocator_settings("expandable_segments:True")
[20:27:24] stdout/INFO  [2026-09-23|20:27:24|core|rank=0] INFO     Enabled expandable_segments (override via PYTORCH_ALLOC_CONF)
[20:27:25] stdout/INFO  [2026-09-23|20:27:25|core|rank=0] INFO     Auto-selected attention backend: fi
[20:27:25] stdout/INFO  [2026-09-23|20:27:25|core|rank=0] INFO     Resolved config: moe_strategy='hybrid', attention_backend='fi', cache_type='hybrid_radix', page_size=1
[20:27:25] stdout/INFO  [2026-09-23|20:27:25|core|rank=0] INFO     Free memory before loading model: 7.21 GiB
[20:27:25] stderr/INFO  Process freetoken-TP0-scheduler:
[20:27:25] stdout/ERROR  [2026-09-23|20:27:25|FrontendAPI] ERROR    Backend supervisor: RuntimeError: flashinfer-cubin version (0.7.0) does not match flashinfer version (0.6.18.post1). Please install the same version of both packages. Set FLASHINFER_DISABLE_VERSION_CHECK=1 to bypass this check.
[20:27:25] stderr/INFO  Traceback (most recent call last):
[20:27:25] stderr/INFO    File "/home/lolmc/.local/share/uv/python/cpython-3.12.14-linux-x86_64-gnu/lib/python3.12/multiprocessing/process.py", line 314, in _bootstrap
[20:27:25] stderr/INFO      self.run()
[20:27:25] stderr/INFO    File "/home/lolmc/.local/share/uv/python/cpython-3.12.14-linux-x86_64-gnu/lib/python3.12/multiprocessing/process.py", line 108, in run
[20:27:25] stderr/INFO      self._target(*self._args, **self._kwargs)
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/server/launch.py", line 81, in _run_scheduler
[20:27:25] stderr/INFO      scheduler = Scheduler(args)
[20:27:25] stderr/INFO                  ^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/scheduler/scheduler.py", line 68, in __init__
[20:27:25] stderr/INFO      self.engine = Engine(config)
[20:27:25] stderr/INFO                    ^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/engine/engine.py", line 359, in __init__
[20:27:25] stderr/INFO      self.model = create_model(config.model_config)
[20:27:25] stderr/INFO                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/__init__.py", line 18, in create_model
[20:27:25] stderr/INFO      return get_model_class(model_config.architectures[0], model_config)
[20:27:25] stderr/INFO             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/register.py", line 337, in get_model_class
[20:27:25] stderr/INFO      return model_cls(model_config)
[20:27:25] stderr/INFO             ^^^^^^^^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/qwen3_5_moe/model.py", line 124, in __init__
[20:27:25] stderr/INFO      super().__init__(config)
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/qwen3_5_moe/model.py", line 102, in __init__
[20:27:25] stderr/INFO      self.model = Qwen3_5Model(config)
[20:27:25] stderr/INFO                   ^^^^^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/qwen3_5_moe/model.py", line 85, in __init__
[20:27:25] stderr/INFO      Qwen3_5DecoderLayer(config, layer_id, prefix=f"{prefix}.layers.{layer_id}")
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/models/qwen3_5_moe/model.py", line 59, in __init__
[20:27:25] stderr/INFO      self.input_layernorm = GemmaRMSNorm(config.hidden_size, eps=config.rms_norm_eps)
[20:27:25] stderr/INFO                             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/freetoken/layers/norm.py", line 40, in __init__
[20:27:25] stderr/INFO      from sgl_kernel import fused_add_rmsnorm, rmsnorm
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/sgl_kernel/__init__.py", line 35, in <module>
[20:27:25] stderr/INFO      from sgl_kernel.elementwise import (
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/sgl_kernel/elementwise.py", line 7, in <module>
[20:27:25] stderr/INFO      import flashinfer.norm as _flashinfer_norm
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/__init__.py", line 25, in <module>
[20:27:25] stderr/INFO      from . import jit as jit
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/jit/__init__.py", line 22, in <module>
[20:27:25] stderr/INFO      from . import cubin_loader
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/jit/cubin_loader.py", line 30, in <module>
[20:27:25] stderr/INFO      from .core import logger
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/jit/core.py", line 15, in <module>
[20:27:25] stderr/INFO      from . import env as jit_env
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/jit/env.py", line 110, in <module>
[20:27:25] stderr/INFO      FLASHINFER_CUBIN_DIR: pathlib.Path = _get_cubin_dir()
[20:27:25] stderr/INFO                                           ^^^^^^^^^^^^^^^^
[20:27:25] stderr/INFO    File "/home/lolmc/.freetoken/venv/lib/python3.12/site-packages/flashinfer/jit/env.py", line 97, in _get_cubin_dir
[20:27:25] stderr/INFO      raise RuntimeError(
[20:27:25] stderr/INFO  RuntimeError: flashinfer-cubin version (0.7.0) does not match flashinfer version (0.6.18.post1). Please install the same version of both packages. Set FLASHINFER_DISABLE_VERSION_CHECK=1 to bypass this check.
[20:27:26] health/ERROR  RuntimeError: flashinfer-cubin version (0.7.0) does not match flashinfer version (0.6.18.post1). Please install the same version of both packages. Set FLASHINFER_DISABLE_VERSION_CHECK=1 to bypass this check.
[20:27:26] stderr/INFO  INFO:     Shutting down
[20:27:26] stderr/INFO  INFO:     Waiting for application shutdown.
[20:27:26] stderr/INFO  INFO:     Application shutdown complete.
[20:27:26] stderr/INFO  INFO:     Finished server process [57188]
[20:27:26] stderr/INFO  /home/lolmc/.local/share/uv/python/cpython-3.12.14-linux-x86_64-gnu/lib/python3.12/multiprocessing/resource_tracker.py:279: UserWarning: resource_tracker: There appear to be 3 leaked semaphore objects to clean up at shutdown
[20:27:26] stderr/INFO    warnings.warn('resource_tracker: There appear to be %d '

Anything else

No response

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    bugSomething isn't workinglinux

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions