Tag

#shell

包含这个标签的文章。

系统运维 289 阅读

Linux 磁盘空间充足却无法创建文件:inode 耗尽的排查与治理实践

## 适用场景 应用报出 `No space left on device`,但 `df -h` 显示磁盘使用率不高;Nginx 无法写入访问日志、容器无法创建临时文件、CI 构建失败,甚至 `touch` 一个空文件也失败。这通常不是字节空间耗尽,而是文件系统可分配的 inode 已经用完。 本文以 ext4/X

阅读全文
Python 338 阅读

Celery 任务积压但部分 Worker 空闲:worker_prefetch_multiplier 引发分配不均的排查与治理

## 适用场景 使用 Celery + Redis/RabbitMQ 承担异步任务。队列中仍有大量待执行任务,但监控显示少数 Worker 忙碌、其余 Worker 空闲;或者短任务被长任务“压住”,整体延迟持续升高。本文以默认的 `prefork` 并发池和 RabbitMQ 为例,Redis broker 的排查

阅读全文
系统运维 363 阅读

Linux OOM Killer 导致服务被杀的排查与治理实践

## 适用场景 这篇文章适用于线上服务突然退出、容器被重启、systemd 日志里只有 `Killed`、监控显示内存瞬时打满,但应用日志没有明确异常栈的场景。常见环境包括物理机、云主机、Docker 容器和 Kubernetes 节点。 OOM Killer 的本质是内核在内存不可回收时主动选择进程终止,以保证系

阅读全文
系统运维 350 阅读

Linux 临时端口耗尽导致接口间歇性超时的排查实践

## 适用场景 这类问题常见于网关、爬虫、批处理任务、消息消费者、API 聚合服务等高并发出站访问场景。应用本身没有明显 CPU 或内存瓶颈,但访问下游服务、Redis、MySQL 代理、HTTP API 时偶发超时,重启应用后短时间恢复,过一会儿又开始失败。 临时端口耗尽的核心原因是:本机主动发起大量 TCP 连

阅读全文
系统运维 386 阅读

Linux 磁盘空间被已删除文件占满的排查与处理

## 适用场景 这类问题常见于日志文件、临时文件或应用输出文件被手动 `rm` 删除后,`df -h` 仍然显示磁盘空间没有释放。典型环境包括: - 业务服务持续写入日志,日志文件被误删或被不规范清理脚本删除。 - Nginx、Java、Python、Go 服务长期运行,进程仍持有旧文件句柄。 - Docker 容

阅读全文