一次 Oracle RAC 节点反复重启故障复盘:从 alert 日志确认数据库不是重启源头,从 Linux 审计排除人工 reboot,从 kdump 和 vmcore-dmesg 定位 Fatal Machine Check,再结合 BMC/XCC 事件确认 CPU1/Socket1 硬件故障。
一次达梦数据库 TRUNCATE / DROP 数据文件残留实验:从 SQL 层面、数据字典、数据文件物理扫描和 10002 trace 多个角度验证数据是否真的被清理,并使用 dmdul 离线抽取工具成功恢复 TRUNCATE 后的测试数据。
一次 Oracle SQL 执行计划异常故障复盘:多个 w3wp.exe 会话集中执行 SQL_ID 4ja6bgs1su89c,child 21 选择低选择性 DEALID 索引,导致约 29.7 亿逻辑读、CPU 接近 100%、latch free 与 cache buffers chains 竞争。最终通过固定好计划、清理坏游标、创建复合索引并收集统计信息恢复稳定。
一篇 Oracle ADG 巡检与故障判断 SOP,系统整理备库侧与主库侧常用 SQL,包含 v$database、v$managed_standby、v$dataguard_stats、v$archive_gap、v$archived_log、v$archive_dest_status 等视图的检查方法,并给出 archive gap、MRP 未启动、主库传输异常、应用慢和 RMAN 增量推进备库的处理流程。
一篇数据库动态数据脱敏实战文档,基于 Oracle DBMS_REDACT 与达梦 DM8 DBMS_RLS 实现身份证号、手机号、工资字段脱敏,覆盖策略创建、字段绑定、普通用户验证、管理员绕过、策略查看和 Oracle / 达梦机制对比。
一次 Oracle 18c 生产恢复实战:业务视图 WMPROD.V_YN_GSP_NBR 被误修改,不采用整库回退,而是使用 RMAN Duplicate 创建辅助库 WMSAUX,恢复到误修改前时间点,提取旧视图定义后精准恢复生产视图。
AI 不会淘汰 DBA,但会淘汰不会使用 AI、不会自动化、不会做系统判断的传统操作型 DBA。未来 DBA 会向 DBRE、数据库架构师、数据平台工程师和 AI 数据基础设施工程师演进。
AI、云数据库、AIGC、多模态数据库和国产数据库快速发展后,DBA 需要从传统数据库运维升级为具备自动化、AI 协作、云数据库、数据生命周期治理和数据基础设施架构能力的复合型工程师。
一次 Oracle 目录权限事故复盘:误执行 chown -R 和 chmod -R 破坏 /u01 权限体系,引发 ORA-12547。通过恢复 ORACLE_HOME、ORACLE_BASE、oraInventory、bin/oracle 权限以及运行目录权限,最终恢复数据库和监听。
一篇 Oracle oratop 实战指南:用类 top 的方式实时观察数据库负载,快速判断问题来自 CPU、I/O、锁等待、提交、RAC GC,还是具体会话和 SQL_ID。