Linux 日志增量统计:inode + offset 方案(不丢不重) 背景我给 Nginx 缓存命中率写了个统计脚本每 5 分钟跑一次读 /var/log/nginx/dashboard_cache.log统计 HIT/MISS 数量写进 MariaDB。第一版逻辑很简单tail-n100/var/log/nginx/dashboard_cache.log|awk{...}跑了两天发现数字不对命中率忽高忽低有时候一小时内 HIT 数突然翻三倍明明只 curl 了几次统计里却有上百条想做到每次只统计「上次跑完之后新增的日志」不重复、不遗漏。就像你每天记账不能把昨天的账再抄一遍也不能漏掉今天新花的钱。原因第一版tail -n 100tail-n100$LOG|awk...问题两次运行之间如果有超过 100 条新日志会漏两次运行之间有重叠的 100 条会重复统计第二版记录行号# 读上次行号 LAST$(cat /tmp/last_line) # 从上次行号之后开始读 tail -n $((LAST1)) $LOG | awk ... # 写本次行号 wc -l $LOG /tmp/last_line问题logrotate 轮转后行号从头开始。行号 500 指向的文件变了。第三版记录文件名tail-n$((LAST1))$LOG还是不对如果文件被删除重建rm 后 touch文件名没变但内容全变了。真正需要的是两个东西的组合inode文件的唯一编号用来判断「是不是同一个文件」offset字节偏移量用来判断「读到哪了」解决核心思路每次运行 1. 读上次记录的 inode offset 2. 对比当前文件的 inode 和大小 3. 如果 inode 变了 → 从头读 如果 offset 当前大小 → 文件被截断 → 从头读 否则 → 从 offset 开始读 4. 处理完记录新的 inode 文件大小完整脚本#!/usr/bin/env bashset-uopipefailLOG/var/log/nginx/dashboard_cache.logSTATE_DIR/home/user/metricsOFFSET_FILE$STATE_DIR/cache.offsetmkdir-p$STATE_DIR# 当前文件状态CUR_INODE$(stat-c%i$LOG)CUR_SIZE$(stat-c%s$LOG)# 上次状态默认 0 0PREV_INODE0PREV_OFFSET0if[-f$OFFSET_FILE];thenread-rPREV_INODE PREV_OFFSET$OFFSET_FILE||truefi# 判断是否需要从头读if[$CUR_INODE!$PREV_INODE]||[$CUR_SIZE-lt$PREV_OFFSET];thenPREV_OFFSET0fi# 从 offset 之后读新内容TMP$(mktemp)traprm -f $TMPEXITtail-c$((PREV_OFFSET1))$LOG$TMP# 处理awk-F\t$10! $10!- { c[$10] } END { for (s in c) print s, c[s] }$TMP# 记录新的 offset下次接着读NEW_SIZE$(stat-c%s$LOG)echo$CUR_INODE$NEW_SIZE$OFFSET_FILE三个关键命令# 1. 拿 inode 和文件大小 CUR_INODE$(stat -c %i $LOG) # 例如 1234567 CUR_SIZE$(stat -c %s $LOG) # 例如 829456 字节 # 2. 从 offset 之后读注意 1tail -c 从 1 开始计数 tail -c $((PREV_OFFSET1)) $LOG # 3. 记录状态到文件 echo $CUR_INODE $NEW_SIZE $OFFSET_FILE验证效果正常情况$catcache.offset1234567829456$sudo/path/to/script.sh HIT90MISS10$catcache.offset1234567829702# 文件涨了 246 字节offset 同步更新模拟 logrotate# 手动模拟把日志挪走新文件进来 sudo mv /var/log/nginx/dashboard_cache.log /var/log/nginx/dashboard_cache.log.1 sudo touch /var/log/nginx/dashboard_cache.log sudo chown www-data:adm /var/log/nginx/dashboard_cache.log sudo systemctl reload nginx # 跑脚本 $ sudo /path/to/script.sh 新文件没内容输出空 # offset 变了因为 inode 变了 $ cat cache.offset 1234568 0 # inode 变了offset 归 0模拟截断# 假装日志被截断 sudo truncate -s 100 /var/log/nginx/dashboard_cache.log # 跑脚本 $ sudo /path/to/script.sh 从 0 开始读读到 100 字节的内容 $ cat cache.offset 1234567 100 # offset 变成当前实际大小不丢不重的验证# 记录当前 HIT 总数$sudogrep-cHIT/var/log/nginx/dashboard_cache.log1000# 跑脚本记下本次新增$sudo/path/to/script.sh HIT50MISS5# 再跑一次应该没有新增$sudo/path/to/script.sh 无输出因为没有新日志# 制造新流量$foriin{1..10};docurl-k-s-o/dev/null https://example.com:8443/;done# 再跑一次$sudo/path/to/script.sh HIT10MISS1两次统计加起来正好等于实际新增不重不漏。三个坑坑 1用行号而不是字节偏移# 错误 wc -l $LOG offset tail -n $((LAST1)) $LOG为什么不行logrotate 后行号从头开始会重复读文件被截断后行号可能变少逻辑就乱了多字节字符中文、UTF-8可能导致行号与内容对应不准正确用 stat -c %s 拿字节数tail -c N 按字节读。坑 2忘了判断 inode 变化# 错误只看大小 if [ $CUR_SIZE -lt $PREV_OFFSET ]; then PREV_OFFSET0 fi问题logrotate 后新文件很小如果新文件恰好比旧 offset 大就不会触发「从头读」会从中间截断读。正确inode 变化和文件变小任意一个满足就从头读。if [ $CUR_INODE ! $PREV_INODE ] || [ $CUR_SIZE -lt $PREV_OFFSET ]; then PREV_OFFSET0 fi坑 3tail -c N 的 1# 错误tail -c $PREV_OFFSET # 这会重复读最后一个字节原因tail -c N 从第 N 个字节开始1 起始。而 offset 记录的是「已经读完的字节数」等价于「下一个未读字节的前一个位置」。所以要用 $((PREV_OFFSET1))。例子文件 abcdefoffset 3已读完 abc下次应该从第 4 个字节 d 开始读tail -c 4 正好从 d 开始 ✅tail -c 3 会从 c 开始 ❌重复读