ik_llama.cpp

History

Kawrakow 05dbbeaf14 imatrix: collect layer influence statistics (#328 ) * imatrix: collect layer influence statistics * imatrix: collect layer influence statiscs also for the last layer For the last layer we need to use the input for the output.weight tensor. Last layer(s) tend(s) to be important, so it is useful to also have its influence metric. * imatrix: separate metric for attention and ffn importance * Use stripped tensor name, not src0->name --------- Co-authored-by: Iwan Kawrakow <iwan.kawrakow@gmail.com>		2025-04-14 19:43:19 +02:00
..
baby-llama	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
batched	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
batched-bench	MoE fix for R4 quants (#170 )	2025-01-12 13:19:14 +02:00
batched.swift	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
benchmark	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
convert-llama2c-to-ggml	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
cvector-generator	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
deprecation-warning	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
embedding	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
eval-callback	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
export-lora	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
gbnf-validator	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
gguf	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
gguf-hash	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
gguf-split	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
gritlm	llama : allow pooled embeddings on any model (#7477 )	2024-06-21 08:38:22 +03:00
imatrix	imatrix: collect layer influence statistics (#328 )	2025-04-14 19:43:19 +02:00
infill	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
jeopardy	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
llama-bench	Add copyright notices (#317 )	2025-04-07 10:43:26 +02:00
llama.android	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
llama.swiftui	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
llava	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
lookahead	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
lookup	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
main	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
main-cmake-pkg	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
parallel	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
passkey	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
perplexity	Fix KLD precision (#325 )	2025-04-12 16:17:50 +02:00
quantize	Add ability to hide imatrix details in llama-quantize (#329 )	2025-04-14 19:41:31 +02:00
quantize-stats	Add copyright notices (#317 )	2025-04-07 10:43:26 +02:00
retrieval	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
rpc	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
save-load-state	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
server	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
simple	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
speculative	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
sweep-bench	Update sweep bench (depracating .jsonl support) (#289 )	2025-03-25 10:14:44 -05:00
sycl	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
tokenize	Merge mainline - Aug 12 2024 (#17 )	2024-08-12 15:14:32 +02:00
base-translate.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
chat-13B.bat	Create chat-13B.bat (#592 )	2023-03-29 20:21:09 +03:00
chat-13B.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
chat-persistent.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
chat-vicuna.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
chat.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
CMakeLists.txt	Add new sweep-bench benchmark (#225 )	2025-02-23 00:16:27 -06:00
convert_legacy_llama.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
json_schema_pydantic_example.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
json_schema_to_grammar.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
llama.vim	llama.vim : added api key support (#5090 )	2024-01-23 08:51:27 +02:00
llm.vim	llm.vim : stop generation at multiple linebreaks, bind to <F2> (#2879 )	2023-08-30 09:50:55 +03:00
Miku.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
pydantic_models_to_grammar_examples.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
pydantic_models_to_grammar.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
reason-act.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
regex_to_grammar.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
server_embd.py	Merge mainline llama.cpp (#3 )	2024-07-27 07:55:01 +02:00
server-llama2-13B.sh	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809 )	2024-06-13 00:41:52 +01:00
ts-type-to-grammar.sh	JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555 )	2024-04-12 19:43:38 +01:00