koboldcpp/src/models
zql b77d646751
model: Add support for Nanbeige4.2 (#25994)
* support nanbeige4.2 model

* fix

* fix flake8 Lint check

* fix loop bound check and drop redundant head_dim

---------

Co-authored-by: root <lizongqiang@kanzhun.com>
2026-07-27 17:04:18 +02:00
..
afmoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
apertus.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
arcee.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
arctic.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
arwkv7.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
baichuan.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
bailingmoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
bailingmoe2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
bert.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
bitnet.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
bloom.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
chameleon.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
chatglm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
codeshell.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
cogvlm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
cohere2.cpp Add arch support for cohere2-MoE (#24260) 2026-06-13 19:49:00 +02:00
cohere2moe.cpp Add arch support for cohere2-MoE (#24260) 2026-06-13 19:49:00 +02:00
command-r.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
dbrx.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
deci.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
deepseek.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
deepseek2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
deepseek2ocr.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
deepseek4.cpp ggml : adjust logic for offloading ops to weight's backend (#25832) 2026-07-27 14:54:46 +03:00
deepseek32.cpp ggml : add GGML_OP_LIGHTNING_INDEXER that implements DeepSeek V3.2/V4 lightning indexer (#24231) 2026-07-11 11:39:07 +02:00
delta-net-base.cpp llama: refactor fused ops (#24646) 2026-07-08 18:18:09 +08:00
dflash.cpp model: rotate injected K/V cache for DFlash (#25823) 2026-07-18 15:02:18 +02:00
dots1.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
dream.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
eagle3.cpp spec: fix segfault error on long prompts for eagle3 (#24707) 2026-06-17 17:29:49 +03:00
ernie4-5-moe.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
ernie4-5.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
eurobert.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
exaone-moe.cpp minor : fix lint issues (#24165) 2026-06-05 11:17:54 +03:00
exaone.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
exaone4.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
falcon-h1.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
falcon.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma-embedding.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma3n.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gemma4-assistant.cpp mtp: support for gemma-4 E2B and E4B assistants (#24282) 2026-06-08 13:48:52 -07:00
gemma4.cpp spec: add EAGLE3 speculative decoding support (#18039) 2026-06-12 10:21:06 +03:00
glm-dsa.cpp model: add GLM 5.2 Indexer support (#25407) 2026-07-24 20:55:56 +02:00
glm4-moe.cpp minor : fix lint issues (#24165) 2026-06-05 11:17:54 +03:00
glm4.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gpt2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
gptneox.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
granite-hybrid.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
granite-moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
granite.cpp model, mtmd: Granite4 Vision (#23545) 2026-06-05 17:44:59 +02:00
grok.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
grovemoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
hunyuan-dense.cpp model: move load_hparams and load_tensors to per-model definition (#22004) 2026-05-04 12:36:59 +02:00
hunyuan-moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
hunyuan-vl.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
hy-v3.cpp model: add Hy3 (hy_v3) support with MTP speculative decoding (#25395) 2026-07-14 00:31:04 +02:00
internlm2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
jais.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
jais2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
jamba.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
jina-bert-v2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
jina-bert-v3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
kimi-linear.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
laguna.cpp Add support for Laguna XS.2 & M.1 (#25165) 2026-07-22 09:54:08 +08:00
lfm2.cpp model : Add label for LFM2.5-230M (#25008) 2026-06-25 18:58:52 +02:00
lfm2moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
llada-moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
llada.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
llama-embed.cpp model: move load_hparams and load_tensors to per-model definition (#22004) 2026-05-04 12:36:59 +02:00
llama.cpp spec: add EAGLE3 speculative decoding support (#18039) 2026-06-12 10:21:06 +03:00
llama4.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
maincoder.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
mamba-base.cpp mamba2: remove hardcoded 2x expansion factor and invalid d_inner % d_state check (#23082) 2026-06-26 08:50:54 +03:00
mamba.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
mamba2.cpp mamba2: remove hardcoded 2x expansion factor and invalid d_inner % d_state check (#23082) 2026-06-26 08:50:54 +03:00
mellum.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
mimo2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
minicpm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
minicpm3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
minimax-m2.cpp spec: add Minimax2 eagle3 support 2026-07-13 15:22:37 +02:00
minimax-m3.cpp model: Add MiniMax-M3 (MSA: MiniMax Sparse Attention) support (#24908) 2026-07-26 19:43:45 +02:00
mistral3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
mistral4.cpp model: move load_hparams and load_tensors to per-model definition (#22004) 2026-05-04 12:36:59 +02:00
models.h model: Add support for Nanbeige4.2 (#25994) 2026-07-27 17:04:18 +02:00
modern-bert.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
mpt.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
nanbeige.cpp model: Add support for Nanbeige4.2 (#25994) 2026-07-27 17:04:18 +02:00
nemotron-h-moe.cpp model: move load_hparams and load_tensors to per-model definition (#22004) 2026-05-04 12:36:59 +02:00
nemotron-h.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
nemotron.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
neo-bert.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
nomic-bert-moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
nomic-bert.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
olmo.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
olmo2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
olmoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
openai-moe.cpp spec: add EAGLE3 speculative decoding support (#18039) 2026-06-12 10:21:06 +03:00
openelm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
orion.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
paddleocr.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
pangu-embed.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
phi2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
phi3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
phimoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
plamo.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
plamo2.cpp models : fix plamo2 attention_key/value_length regression (#24317) 2026-06-09 10:26:44 +03:00
plamo3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
plm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen2moe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen2vl.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
qwen3.cpp spec: add EAGLE3 speculative decoding support (#18039) 2026-06-12 10:21:06 +03:00
qwen3moe.cpp spec: add EAGLE3 speculative decoding support (#18039) 2026-06-12 10:21:06 +03:00
qwen3next.cpp model : register t_layer_inp for qwen3next (#25141) 2026-06-30 17:57:14 +02:00
qwen3vl.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen3vlmoe.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
qwen35.cpp spec: support eagle3 for qwen3.5 & 3.6 (#24593) 2026-06-19 13:08:50 +03:00
qwen35moe.cpp spec: support eagle3 for qwen3.5 & 3.6 (#24593) 2026-06-19 13:08:50 +03:00
refact.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
rnd1.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
rwkv6-base.cpp models : deduplicate delta-net graphs for Qwen family (#19597) 2026-02-16 14:35:04 +02:00
rwkv6.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
rwkv6qwen2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
rwkv7-base.cpp models : deduplicate delta-net graphs for Qwen family (#19597) 2026-02-16 14:35:04 +02:00
rwkv7.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
seed-oss.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
smallthinker.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
smollm3.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
stablelm.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
starcoder.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
starcoder2.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
step35.cpp spec : Support Step3.5/3.7 flash mtp3 (#24340) 2026-06-21 11:33:18 +03:00
t5.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
t5encoder.cpp model: move load_hparams and load_tensors to per-model definition (#22004) 2026-05-04 12:36:59 +02:00
talkie.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00
wavtokenizer-dec.cpp model : NvFP4 quantized LM head support (#23046) 2026-05-16 11:09:27 +02:00
xverse.cpp hparams : refactor hparams.n_layer (#24060) 2026-06-05 11:09:36 +03:00