model=/mnt/data/models/ubergarm/MiniMax-M2.7-GGUF/MiniMax-M2.7-Q8_0.gguf numactl -N "$SOCKET" -m "$SOCKET" \ ./build/bin/llama-perplexity \ -m "$model" \ -f wiki.test.raw \ --seed 1337 \ --ctx-size 512 \ -ub 4096 -b 4096 \ --numa numactl \ --threads 96 \ --threads-batch 128 \ --validate-quants \ --no-mmap SOCKET is set to: 0 main: build = 4408 (08ae48c6) main: built with cc (Ubuntu 13.3.0-6ubuntu2~24.04.1) 13.3.0 for x86_64-linux-gnu main: seed = 1337 CPU: using device CPU - 0 MiB free llama_model_loader: loaded meta data with 37 key-value pairs and 809 tensors from /mnt/data/models/ubergarm/MiniMax-M2.7-GGUF/MiniMax-M2.7-Q8_0.gguf (version GGUF V3 (latest)) llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output. llama_model_loader: - kv 0: general.architecture str = minimax-m2 llama_model_loader: - kv 1: general.type str = model llama_model_loader: - kv 2: general.sampling.top_k i32 = 40 llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000 llama_model_loader: - kv 4: general.sampling.temp f32 = 1.000000 llama_model_loader: - kv 5: general.name str = MiniMax M2.7 llama_model_loader: - kv 6: general.size_label str = 256x4.9B llama_model_loader: - kv 7: general.license str = other llama_model_loader: - kv 8: general.license.name str = modified-mit llama_model_loader: - kv 9: general.license.link str = https://github.com/MiniMax-AI/MiniMax... llama_model_loader: - kv 10: general.tags arr[str,1] = ["text-generation"] llama_model_loader: - kv 11: minimax-m2.block_count u32 = 62 llama_model_loader: - kv 12: minimax-m2.context_length u32 = 196608 llama_model_loader: - kv 13: minimax-m2.embedding_length u32 = 3072 llama_model_loader: - kv 14: minimax-m2.feed_forward_length u32 = 1536 llama_model_loader: - kv 15: minimax-m2.attention.head_count u32 = 48 llama_model_loader: - kv 16: minimax-m2.attention.head_count_kv u32 = 8 llama_model_loader: - kv 17: minimax-m2.rope.freq_base f32 = 5000000.000000 llama_model_loader: - kv 18: minimax-m2.attention.layer_norm_rms_epsilon f32 = 0.000001 llama_model_loader: - kv 19: minimax-m2.expert_count u32 = 256 llama_model_loader: - kv 20: minimax-m2.expert_used_count u32 = 8 llama_model_loader: - kv 21: minimax-m2.expert_gating_func u32 = 2 llama_model_loader: - kv 22: minimax-m2.attention.key_length u32 = 128 llama_model_loader: - kv 23: minimax-m2.attention.value_length u32 = 128 llama_model_loader: - kv 24: general.file_type u32 = 7 llama_model_loader: - kv 25: minimax-m2.expert_feed_forward_length u32 = 1536 llama_model_loader: - kv 26: minimax-m2.rope.dimension_count u32 = 64 llama_model_loader: - kv 27: general.quantization_version u32 = 2 llama_model_loader: - kv 28: tokenizer.ggml.model str = gpt2 llama_model_loader: - kv 29: tokenizer.ggml.pre str = minimax-m2 llama_model_loader: - kv 30: tokenizer.ggml.tokens arr[str,200064] = ["Ā", "ā", "Ă", "ă", "Ą", "ą", ... llama_model_loader: - kv 31: tokenizer.ggml.token_type arr[i32,200064] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ... llama_model_loader: - kv 32: tokenizer.ggml.merges arr[str,199744] = ["Ġ Ġ", "Ġ t", "Ġ a", "i n", "e r... llama_model_loader: - kv 33: tokenizer.ggml.bos_token_id u32 = 200034 llama_model_loader: - kv 34: tokenizer.ggml.eos_token_id u32 = 200020 llama_model_loader: - kv 35: tokenizer.ggml.unknown_token_id u32 = 200021 llama_model_loader: - kv 36: tokenizer.chat_template str = {# ----------‑‑‑ special token ... llama_model_loader: - type f32: 373 tensors llama_model_loader: - type q8_0: 436 tensors load: 0 unused tokens load: special_eos_id is not in special_eog_ids - the tokenizer config may be incorrect load: printing all EOG tokens: load: - 200004 ('') load: - 200005 ('') load: - 200020 ('[e~[') load: special tokens cache size = 54 load: token to piece cache size = 1.3355 MB llm_load_print_meta: format = GGUF V3 (latest) llm_load_print_meta: arch = minimax-m2 llm_load_print_meta: n_ctx_train = 196608 llm_load_print_meta: n_embd = 3072 llm_load_print_meta: n_layer = 62 llm_load_print_meta: n_head = 48 llm_load_print_meta: n_head_kv = 8 llm_load_print_meta: n_rot = 64 llm_load_print_meta: n_swa = 0 llm_load_print_meta: n_swa_pattern = 1 llm_load_print_meta: n_embd_head_k = 128 llm_load_print_meta: n_embd_head_v = 128 llm_load_print_meta: n_gqa = 6 llm_load_print_meta: n_embd_k_gqa = 1024 llm_load_print_meta: n_embd_v_gqa = 1024 llm_load_print_meta: f_norm_eps = 0.0e+00 llm_load_print_meta: f_norm_rms_eps = 1.0e-06 llm_load_print_meta: f_clamp_kqv = 0.0e+00 llm_load_print_meta: f_max_alibi_bias = 0.0e+00 llm_load_print_meta: f_logit_scale = 0.0e+00 llm_load_print_meta: n_ff = 1536 llm_load_print_meta: n_expert = 256 llm_load_print_meta: n_expert_used = 8 llm_load_print_meta: causal attn = 1 llm_load_print_meta: pooling type = 0 llm_load_print_meta: rope type = 2 llm_load_print_meta: rope scaling = linear llm_load_print_meta: freq_base_train = 5000000.0 llm_load_print_meta: freq_scale_train = 1 llm_load_print_meta: n_ctx_orig_yarn = 196608 llm_load_print_meta: rope_finetuned = unknown llm_load_print_meta: ssm_d_conv = 0 llm_load_print_meta: ssm_d_inner = 0 llm_load_print_meta: ssm_d_state = 0 llm_load_print_meta: ssm_dt_rank = 0 llm_load_print_meta: ssm_n_group = 0 llm_load_print_meta: model type = 230B.A10B llm_load_print_meta: model ftype = Q8_0 llm_load_print_meta: model params = 228.690 B llm_load_print_meta: model size = 226.431 GiB (8.505 BPW) llm_load_print_meta: repeating layers = 225.215 GiB (8.505 BPW, 227.461 B parameters) llm_load_print_meta: general.name = MiniMax M2.7 print_info: vocab type = BPE print_info: n_vocab = 200064 print_info: n_merges = 199744 print_info: BOS token = 200034 ']~!b[' print_info: EOS token = 200020 '[e~[' print_info: UNK token = 200021 ']!d~[' print_info: LF token = 10 'Ċ' print_info: FIM PRE token = 200001 '' print_info: FIM SUF token = 200003 '' print_info: FIM MID token = 200002 '' print_info: FIM PAD token = 200004 '' print_info: FIM REP token = 200005 '' print_info: EOG token = 200004 '' print_info: EOG token = 200005 '' print_info: EOG token = 200020 '[e~[' print_info: max token length = 256 ======================================= HAVE_FANCY_SIMD is defined Free memory 0 MiB on device 0 is less the 1024 MiB safety margin ------------------- Layer sizes: Layer 0: 3719.68, 16.00, 3735.68 864.00 MiB Layer 1: 3719.68, 16.00, 3735.68 864.00 MiB Layer 2: 3719.68, 16.00, 3735.68 864.00 MiB Layer 3: 3719.68, 16.00, 3735.68 864.00 MiB Layer 4: 3719.68, 16.00, 3735.68 864.00 MiB Layer 5: 3719.68, 16.00, 3735.68 864.00 MiB Layer 6: 3719.68, 16.00, 3735.68 864.00 MiB Layer 7: 3719.68, 16.00, 3735.68 864.00 MiB Layer 8: 3719.68, 16.00, 3735.68 864.00 MiB Layer 9: 3719.68, 16.00, 3735.68 864.00 MiB Layer 10: 3719.68, 16.00, 3735.68 864.00 MiB Layer 11: 3719.68, 16.00, 3735.68 864.00 MiB Layer 12: 3719.68, 16.00, 3735.68 864.00 MiB Layer 13: 3719.68, 16.00, 3735.68 864.00 MiB Layer 14: 3719.68, 16.00, 3735.68 864.00 MiB Layer 15: 3719.68, 16.00, 3735.68 864.00 MiB Layer 16: 3719.68, 16.00, 3735.68 864.00 MiB Layer 17: 3719.68, 16.00, 3735.68 864.00 MiB Layer 18: 3719.68, 16.00, 3735.68 864.00 MiB Layer 19: 3719.68, 16.00, 3735.68 864.00 MiB Layer 20: 3719.68, 16.00, 3735.68 864.00 MiB Layer 21: 3719.68, 16.00, 3735.68 864.00 MiB Layer 22: 3719.68, 16.00, 3735.68 864.00 MiB Layer 23: 3719.68, 16.00, 3735.68 864.00 MiB Layer 24: 3719.68, 16.00, 3735.68 864.00 MiB Layer 25: 3719.68, 16.00, 3735.68 864.00 MiB Layer 26: 3719.68, 16.00, 3735.68 864.00 MiB Layer 27: 3719.68, 16.00, 3735.68 864.00 MiB Layer 28: 3719.68, 16.00, 3735.68 864.00 MiB Layer 29: 3719.68, 16.00, 3735.68 864.00 MiB Layer 30: 3719.68, 16.00, 3735.68 864.00 MiB Layer 31: 3719.68, 16.00, 3735.68 864.00 MiB Layer 32: 3719.68, 16.00, 3735.68 864.00 MiB Layer 33: 3719.68, 16.00, 3735.68 864.00 MiB Layer 34: 3719.68, 16.00, 3735.68 864.00 MiB Layer 35: 3719.68, 16.00, 3735.68 864.00 MiB Layer 36: 3719.68, 16.00, 3735.68 864.00 MiB Layer 37: 3719.68, 16.00, 3735.68 864.00 MiB Layer 38: 3719.68, 16.00, 3735.68 864.00 MiB Layer 39: 3719.68, 16.00, 3735.68 864.00 MiB Layer 40: 3719.68, 16.00, 3735.68 864.00 MiB Layer 41: 3719.68, 16.00, 3735.68 864.00 MiB Layer 42: 3719.68, 16.00, 3735.68 864.00 MiB Layer 43: 3719.68, 16.00, 3735.68 864.00 MiB Layer 44: 3719.68, 16.00, 3735.68 864.00 MiB Layer 45: 3719.68, 16.00, 3735.68 864.00 MiB Layer 46: 3719.68, 16.00, 3735.68 864.00 MiB Layer 47: 3719.68, 16.00, 3735.68 864.00 MiB Layer 48: 3719.68, 16.00, 3735.68 864.00 MiB Layer 49: 3719.68, 16.00, 3735.68 864.00 MiB Layer 50: 3719.68, 16.00, 3735.68 864.00 MiB Layer 51: 3719.68, 16.00, 3735.68 864.00 MiB Layer 52: 3719.68, 16.00, 3735.68 864.00 MiB Layer 53: 3719.68, 16.00, 3735.68 864.00 MiB Layer 54: 3719.68, 16.00, 3735.68 864.00 MiB Layer 55: 3719.68, 16.00, 3735.68 864.00 MiB Layer 56: 3719.68, 16.00, 3735.68 864.00 MiB Layer 57: 3719.68, 16.00, 3735.68 864.00 MiB Layer 58: 3719.68, 16.00, 3735.68 864.00 MiB Layer 59: 3719.68, 16.00, 3735.68 864.00 MiB Layer 60: 3719.68, 16.00, 3735.68 864.00 MiB Layer 61: 3719.68, 16.00, 3735.68 864.00 MiB Layer 62: 622.76, 2262.00, 2884.76 MiB (output layer) -------------------------------------------------------------------------- Total : 230619.96, 3254.00, 233873.96 MiB Free memory 0 MiB on device 0 is less the required compute buffer size 864 MiB Memory required for model tensors + cache: 234497 MiB Memory available on all devices - compute: 0 MiB llm_load_tensors: ggml ctx size = 0.35 MiB llm_load_tensors: offloading 0 repeating layers to GPU llm_load_tensors: offloaded 0/63 layers to GPU llm_load_tensors: CPU buffer size = 231865.49 MiB .................................................................................................... llama_init_from_model: n_ctx = 4096 llama_init_from_model: n_batch = 4096 llama_init_from_model: n_ubatch = 4096 llama_init_from_model: flash_attn = 1 llama_init_from_model: attn_max_b = 0 llama_init_from_model: fused_moe = 1 llama_init_from_model: grouped er = 0 llama_init_from_model: fused_up_gate = 1 llama_init_from_model: fused_mmad = 1 llama_init_from_model: rope_cache = 0 llama_init_from_model: graph_reuse = 1 llama_init_from_model: k_cache_hadam = 0 llama_init_from_model: v_cache_hadam = 0 llama_init_from_model: split_mode_graph_scheduling = 0 llama_init_from_model: reduce_type = f16 llama_init_from_model: sched_async = 0 llama_init_from_model: ser = -1, 0 llama_init_from_model: freq_base = 5000000.0 llama_init_from_model: freq_scale = 1 llama_kv_cache_init: CPU KV buffer size = 992.00 MiB llama_init_from_model: KV self size = 992.00 MiB, K (f16): 496.00 MiB, V (f16): 496.00 MiB llama_init_from_model: CPU output buffer size = 6.11 MiB llama_init_from_model: CPU compute buffer size = 3222.00 MiB llama_init_from_model: graph nodes = 2361 llama_init_from_model: graph splits = 1 llama_init_from_model: enabling only_active_experts scheduling system_info: n_threads = 96 (n_threads_batch = 128) / 512 | AVX = 1 | AVX_VNNI = 1 | AVX2 = 1 | AVX512 = 1 | AVX512_VBMI = 1 | AVX512_VNNI = 1 | AVX512_BF16 = 1 | FMA = 1 | NEON = 0 | SVE = 0 | ARM_FMA = 0 | F16C = 1 | FP16_VA = 0 | WASM_SIMD = 0 | BLAS = 0 | SSE3 = 1 | SSSE3 = 1 | VSX = 0 | MATMUL_INT8 = 0 | perplexity: tokenizing the input .. perplexity: tokenization took 600.676 ms perplexity: calculating perplexity over 552 chunks, n_ctx=512, batch_size=4096, n_seq=8 perplexity: 9.00 seconds per pass - ETA 10.35 minutes [1]3.6698,[2]4.5049,[3]4.0407,[4]4.6415,[5]4.9881,[6]5.5023,[7]5.8835,[8]6.8004,[9]7.2272,[10]7.4251,[11]7.5452,[12]7.9405,[13]8.0083,[14]7.8613,[15]8.0360,[16]7.6730,[17]7.8141,[18]7.7892,[19]7.6547,[20]7.4219,[21]7.3425,[22]7.1145,[23]6.8751,[24]6.7548,[25]6.4322,[26]6.2588,[27]6.3801,[28]6.3698,[29]6.4253,[30]6.4286,[31]6.3830,[32]6.4208,[33]6.5415,[34]6.7083,[35]6.8226,[36]6.7761,[37]6.8208,[38]6.8889,[39]6.8869,[40]6.9962,[41]7.0551,[42]7.0107,[43]7.0146,[44]7.1681,[45]7.2599,[46]7.2363,[47]7.2079,[48]7.2156,[49]7.2458,[50]7.3147,[51]7.3432,[52]7.3661,[53]7.4187,[54]7.4332,[55]7.4775,[56]7.4464,[57]7.4713,[58]7.4426,[59]7.4788,[60]7.5442,[61]7.6316,[62]7.6968,[63]7.7437,[64]7.7346,[65]7.7513,[66]7.7537,[67]7.7785,[68]7.8274,[69]7.8440,[70]7.8590,[71]7.8038,[72]7.8061,[73]7.8468,[74]7.8484,[75]7.7343,[76]7.6786,[77]7.6897,[78]7.7080,[79]7.7153,[80]7.7182,[81]7.7618,[82]7.7539,[83]7.7499,[84]7.7628,[85]7.7611,[86]7.8419,[87]7.8433,[88]7.8682,[89]7.8804,[90]7.8782,[91]7.8757,[92]7.8421,[93]7.8541,[94]7.8499,[95]7.8994,[96]7.9122,[97]7.9313,[98]7.9338,[99]7.9269,[100]7.9189,[101]7.9887,[102]8.0346,[103]8.0956,[104]8.1258,[105]8.2068,[106]8.2354,[107]8.2034,[108]8.2829,[109]8.3284,[110]8.2955,[111]8.2510,[112]8.2485,[113]8.2054,[114]8.2046,[115]8.1592,[116]8.1393,[117]8.1004,[118]8.0811,[119]8.0311,[120]7.9963,[121]7.9649,[122]7.8992,[123]7.8544,[124]7.8150,[125]7.7712,[126]7.7582,[127]7.7596,[128]7.7719,[129]7.7640,[130]7.7553,[131]7.7639,[132]7.7773,[133]7.7835,[134]7.8006,[135]7.7945,[136]7.7876,[137]7.7889,[138]7.7419,[139]7.7126,[140]7.6747,[141]7.6475,[142]7.6023,[143]7.5632,[144]7.5340,[145]7.5230,[146]7.4932,[147]7.4696,[148]7.4211,[149]7.3881,[150]7.3672,[151]7.3460,[152]7.3198,[153]7.3118,[154]7.2873,[155]7.2839,[156]7.2687,[157]7.2693,[158]7.2780,[159]7.2831,[160]7.3033,[161]7.3220,[162]7.3672,[163]7.4050,[164]7.4391,[165]7.4943,[166]7.5137,[167]7.5480,[168]7.5754,[169]7.5889,[170]7.5873,[171]7.5871,[172]7.6132,[173]7.5843,[174]7.5935,[175]7.5981,[176]7.6049,[177]7.6083,[178]7.6067,[179]7.6430,[180]7.6734,[181]7.6967,[182]7.7014,[183]7.7268,[184]7.7685,[185]7.7996,[186]7.8180,[187]7.8258,[188]7.8225,[189]7.8006,[190]7.7996,[191]7.7871,[192]7.8137,[193]7.8369,[194]7.8598,[195]7.8574,[196]7.8692,[197]7.8449,[198]7.8745,[199]7.8484,[200]7.8362,[201]7.8219,[202]7.8068,[203]7.7941,[204]7.7924,[205]7.8022,[206]7.8096,[207]7.7924,[208]7.7621,[209]7.7483,[210]7.7464,[211]7.7309,[212]7.7265,[213]7.7172,[214]7.6853,[215]7.6607,[216]7.6491,[217]7.6260,[218]7.6118,[219]7.6064,[220]7.6019,[221]7.5981,[222]7.5723,[223]7.5615,[224]7.5558,[225]7.5508,[226]7.5494,[227]7.5543,[228]7.5623,[229]7.5605,[230]7.5748,[231]7.5788,[232]7.6065,[233]7.6260,[234]7.6382,[235]7.6481,[236]7.6633,[237]7.6821,[238]7.6847,[239]7.7021,[240]7.7336,[241]7.7499,[242]7.7529,[243]7.7620,[244]7.7555,[245]7.7245,[246]7.7068,[247]7.6880,[248]7.6792,[249]7.6788,[250]7.6863,[251]7.6854,[252]7.6764,[253]7.6631,[254]7.6658,[255]7.6508,[256]7.6375,[257]7.6263,[258]7.6151,[259]7.6154,[260]7.6140,[261]7.5940,[262]7.5922,[263]7.5789,[264]7.5725,[265]7.5663,[266]7.5437,[267]7.5443,[268]7.5125,[269]7.5027,[270]7.4989,[271]7.4917,[272]7.4802,[273]7.4802,[274]7.4953,[275]7.5044,[276]7.5141,[277]7.5227,[278]7.5289,[279]7.5396,[280]7.5496,[281]7.5651,[282]7.5576,[283]7.5510,[284]7.5536,[285]7.5497,[286]7.5453,[287]7.5411,[288]7.5551,[289]7.5661,[290]7.5649,[291]7.5649,[292]7.5647,[293]7.5649,[294]7.5686,[295]7.5748,[296]7.5763,[297]7.5790,[298]7.5804,[299]7.5833,[300]7.5944,[301]7.6010,[302]7.5925,[303]7.5882,[304]7.5764,[305]7.5841,[306]7.5931,[307]7.6046,[308]7.6255,[309]7.6258,[310]7.6389,[311]7.6323,[312]7.6356,[313]7.6262,[314]7.6200,[315]7.6244,[316]7.6153,[317]7.6150,[318]7.6236,[319]7.6177,[320]7.6326,[321]7.6285,[322]7.6303,[323]7.6257,[324]7.6209,[325]7.6184,[326]7.6291,[327]7.6344,[328]7.6306,[329]7.6289,[330]7.6193,[331]7.6101,[332]7.5993,[333]7.5993,[334]7.5945,[335]7.5840,[336]7.5948,[337]7.6024,[338]7.6135,[339]7.6068,[340]7.6049,[341]7.6009,[342]7.6079,[343]7.6013,[344]7.5942,[345]7.6035,[346]7.6201,[347]7.6418,[348]7.6658,[349]7.6748,[350]7.6924,[351]7.7123,[352]7.7247,[353]7.7383,[354]7.7442,[355]7.7566,[356]7.7674,[357]7.7636,[358]7.7778,[359]7.7926,[360]7.7999,[361]7.8112,[362]7.8204,[363]7.8335,[364]7.8435,[365]7.8649,[366]7.8759,[367]7.8751,[368]7.8798,[369]7.8861,[370]7.9106,[371]7.9263,[372]7.9307,[373]7.9223,[374]7.9199,[375]7.9248,[376]7.9347,[377]7.9387,[378]7.9478,[379]7.9552,[380]7.9624,[381]7.9762,[382]7.9722,[383]7.9456,[384]7.9401,[385]7.9316,[386]7.9363,[387]7.9407,[388]7.9387,[389]7.9439,[390]7.9513,[391]7.9418,[392]7.9304,[393]7.9277,[394]7.9152,[395]7.9075,[396]7.9064,[397]7.9055,[398]7.8925,[399]7.8819,[400]7.8733,[401]7.8657,[402]7.8558,[403]7.8451,[404]7.8352,[405]7.8360,[406]7.8477,[407]7.8573,[408]7.8476,[409]7.8406,[410]7.8456,[411]7.8330,[412]7.8339,[413]7.8346,[414]7.8314,[415]7.8338,[416]7.8263,[417]7.8207,[418]7.8138,[419]7.8133,[420]7.8093,[421]7.8060,[422]7.8014,[423]7.7994,[424]7.7923,[425]7.7841,[426]7.7701,[427]7.7666,[428]7.7573,[429]7.7460,[430]7.7339,[431]7.7236,[432]7.7288,[433]7.7429,[434]7.7513,[435]7.7635,[436]7.7603,[437]7.7598,[438]7.7595,[439]7.7667,[440]7.7657,[441]7.7682,[442]7.7708,[443]7.7824,[444]7.7912,[445]7.7928,[446]7.7978,[447]7.7907,[448]7.7920,[449]7.7848,[450]7.7924,[451]7.7999,[452]7.7990,[453]7.7970,[454]7.7887,[455]7.7910,[456]7.8012,[457]7.8031,[458]7.8086,[459]7.8177,[460]7.8220,[461]7.8213,[462]7.8265,[463]7.8258,[464]7.8284,[465]7.8278,[466]7.8222,[467]7.8239,[468]7.8210,[469]7.8175,[470]7.8189,[471]7.8240,[472]7.8350,[473]7.8276,[474]7.8303,[475]7.8273,[476]7.8322,[477]7.8434,[478]7.8476,[479]7.8533,[480]7.8619,[481]7.8645,[482]7.8631,[483]7.8705,[484]7.8761,[485]7.8695,[486]7.8648,[487]7.8605,[488]7.8568,[489]7.8538,[490]7.8457,[491]7.8495,[492]7.8497,[493]7.8605,[494]7.8480,[495]7.8465,[496]7.8458,[497]7.8495,[498]7.8567,[499]7.8605,[500]7.8544,[501]7.8475,[502]7.8403,[503]7.8492,[504]7.8490,[505]7.8512,[506]7.8560,[507]7.8525,[508]7.8545,[509]7.8662,[510]7.8613,[511]7.8743,[512]7.8776,[513]7.8696,[514]7.8738,[515]7.8785,[516]7.8839,[517]7.8797,[518]7.8638,[519]7.8640,[520]7.8593,[521]7.8521,[522]7.8472,[523]7.8232,[524]7.8191,[525]7.8196,[526]7.8229,[527]7.8300,[528]7.8301,[529]7.8399,[530]7.8490,[531]7.8581,[532]7.8673,[533]7.8738,[534]7.8884,[535]7.8849,[536]7.8856,[537]7.8744,[538]7.8698,[539]7.8648,[540]7.8617,[541]7.8650,[542]7.8658,[543]7.8648,[544]7.8602,[545]7.8613,[546]7.8569,[547]7.8552,[548]7.8622,[549]7.8671,[550]7.8793,[551]7.8780,[552]7.8764, llama_print_timings: load time = 52671.97 ms llama_print_timings: sample time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second) llama_print_timings: prompt eval time = 505254.25 ms / 282624 tokens ( 1.79 ms per token, 559.37 tokens per second) llama_print_timings: eval time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second) llama_print_timings: total time = 515975.49 ms / 282625 tokens Final estimate: PPL over 552 chunks for n_ctx=512 = 7.8764 +/- 0.05997