测试环境与配置 (Test Environment)

核心数据对比分析 (Core Data Comparison)

指标维度 数据组 1: CPU/Host 推理 (0层 Offload) 数据组 2: HTP 卸载 (32层 Offload) 数据组 3: 只有2层
推理框架 llama.cpp llama.cpp QNN Genie
层数 32 32 2
Prompt Tokens 19 (测试片段) 19 (测试片段) 698 (原始输入规模)
Gen Tokens 458 177 100 (生成规模)
Prompt Eval Rate 240.23 toks/sec 150.10 toks/sec 66666.66 toks/sec
Token Generation Rate 134.60 toks/sec 40.01 toks/sec 800.64 toks/sec
首字延迟 (TTFT) 79 ms 126 ms 11.1 ms
Total Time 4749.14 ms 9791.92 ms -
Unaccounted Time % 26.3 % 53.4 % -
HTP0 Compute Mem 0 MiB 32.26 MiB 0 MiB
Host Memory Usage 719 MiB 747 MiB -

深度技术洞察 (Deep Dive Analysis)

A. Eval 速度断崖式下跌

B. "Unaccounted Time" 的严重异常

C. 计算后端切换:HTP0 (Hexagon) 的差异

D. 内存分布分析

总结与实践建议 (Conclusion & Recommendations)

附:技术细节

llama.cpp (CPU) 关键性能指标解析

llama.cpp (HTP)

genie-t2t-run 关键性能指标解析

{  
  "GenieDialog_create": { "duration": 268960 },  
  "GenieDialog_query": {  
    "prompt-processing-rate": 66666.66,   // 698 tok → ~10.5 ms  
    "time-to-first-token":     10819,      // 10.8 ms  
    "token-generation-rate":   801,       // 100 tok → 124.9 ms  
    "token-generation-time":   124918     // 124.9 ms  
  },  
  "GenieDialog_free": { "duration": 19399 }  
}