跳过正文

Oracle 11g

从连接数耗尽到 TX 行锁:一次 Oracle 11g RAC 故障排查记录

一次 Oracle 11g RAC 故障复盘:表面是连接数耗尽,实际根因是高并发 UPDATE 触发行级 Trigger,Trigger 双重循环中的 DELETE 对近 300 万行表反复全表扫描,拖长事务持锁时间,最终放大 TX 行锁并耗尽 Session。

记一次 Oracle RAC Level 0 备份连续失败:从 NetBackup Status 6 到 datafile 264 恢复

一次 Oracle RAC RMAN 与 NetBackup 联合故障处理:从 Status 6 追到 datafile 264 固定块 I/O 读取失败,迁移故障 extent 后生成救援 Level 0 backupset,将数据文件恢复到新的 ASM 文件,并完成物理、逻辑及 SBT 单文件备份验证。

记一次 Oracle RAC 节点反复重启:从告警日志到 vmcore 定位 CPU 硬件故障

一次 Oracle RAC 节点反复重启故障复盘:从 alert 日志确认数据库不是重启源头,从 Linux 审计排除人工 reboot,从 kdump 和 vmcore-dmesg 定位 Fatal Machine Check,再结合 BMC/XCC 事件确认 CPU1/Socket1 硬件故障。

记一次由 SQL 执行计划异常引发的高 CPU 与 cache buffers chains 竞争故障处理

一次 Oracle SQL 执行计划异常故障复盘:多个 w3wp.exe 会话集中执行 SQL_ID 4ja6bgs1su89c,child 21 选择低选择性 DEALID 索引,导致约 29.7 亿逻辑读、CPU 接近 100%、latch free 与 cache buffers chains 竞争。最终通过固定好计划、清理坏游标、创建复合索引并收集统计信息恢复稳定。

记一次 1000+ 每秒 UPDATE 引发的 Redo 风暴:AWR 定位 log file switch checkpoint incomplete

一次 Oracle Redo 风暴处理实战:生产库磁盘使用率超过 90%,日志切换从每小时十几次飙升到数百次,AWR 显示 log file switch checkpoint incomplete 占 DB time 约 41%,最终定位 SQL_ID 0vq0s6rm8fawn 每小时执行 376 万次,约 1000+ 次/秒 UPDATE。