---
categoria: Processos
tempo_medio: 12-15 min
nivel_tecnico: Intermediário
---

# Gestão de Incidentes

## Objetivo

Compreender o que é um incidente, como ele deve ser tratado dentro de uma organização e por que uma gestão estruturada de incidentes reduz impactos, melhora a qualidade dos serviços e acelera a recuperação das operações.

---

## O que é um incidente?

Um **incidente** é qualquer evento que interrompa ou reduza a qualidade normal de um serviço.

Nem todo incidente representa uma falha grave.

Pode ser desde uma indisponibilidade completa até uma degradação parcial do serviço.

Exemplos:

- cliente sem acesso à internet;
- servidor indisponível;
- lentidão na rede;
- equipamento com defeito;
- sistema inacessível;
- falha em autenticação;
- perda de comunicação entre equipamentos.

O objetivo da gestão de incidentes é restaurar o funcionamento normal do serviço no menor tempo possível.

---

## Incidente x Problema

Esses termos costumam ser confundidos.

Eles representam conceitos diferentes.

| Incidente | Problema |
|-----------|----------|
| Evento que afeta um serviço. | Causa raiz de um ou mais incidentes. |
| Precisa ser resolvido rapidamente. | Precisa ser investigado para evitar recorrências. |
| Foco na restauração do serviço. | Foco na eliminação da causa. |

Exemplo:

Cliente está sem internet.

Esse é o incidente.

Após investigação descobre-se que um módulo óptico apresentou falha de fabricação.

Essa é a causa do problema.

Resolver o incidente devolve o serviço.

Resolver o problema evita que novos incidentes ocorram.

---

## Objetivos da gestão de incidentes

Uma gestão eficiente busca:

- restaurar o serviço rapidamente;
- reduzir impactos ao usuário;
- minimizar interrupções operacionais;
- registrar informações relevantes;
- produzir histórico para análises futuras;
- identificar padrões de recorrência.

O foco inicial é devolver o serviço ao funcionamento normal.

---

## O ciclo de vida de um incidente

Embora existam diferentes metodologias, o tratamento normalmente segue um fluxo semelhante.

```
Identificação

↓

Registro

↓

Classificação

↓

Priorização

↓

Diagnóstico

↓

Resolução

↓

Validação

↓

Encerramento

↓

Análise para melhoria
```

Cada etapa possui um objetivo específico.

---

## Identificação

O incidente pode ser identificado de diversas formas.

Exemplos:

- contato do cliente;
- monitoramento automático;
- alerta de sistema;
- inspeção preventiva;
- equipe técnica.

Quanto mais cedo um incidente for identificado, menor tende a ser seu impacto.

---

## Registro

Todo incidente deve ser registrado.

Esse registro normalmente contém:

- data e hora;
- descrição do problema;
- responsável;
- equipamentos envolvidos;
- cliente ou setor afetado;
- evidências;
- ações executadas.

Essas informações são importantes tanto para auditoria quanto para melhoria contínua.

---

## Classificação

Após o registro, o incidente deve ser classificado.

A classificação pode considerar:

- tipo de serviço;
- equipamento envolvido;
- tecnologia;
- categoria técnica;
- origem da falha.

Uma boa classificação facilita pesquisas futuras e análises estatísticas.

---

## Priorização

Nem todos os incidentes possuem o mesmo impacto.

Alguns exemplos:

| Prioridade | Situação |
|------------|----------|
| Crítica | Serviço totalmente indisponível para muitos usuários. |
| Alta | Grande impacto operacional. |
| Média | Impacto limitado a poucos usuários. |
| Baixa | Solicitações sem urgência imediata. |

A prioridade orienta a ordem de atendimento.

---

## Diagnóstico

Nesta etapa procura-se identificar a causa mais provável do incidente.

Isso pode envolver:

- análise de logs;
- testes de conectividade;
- inspeção física;
- consulta a monitoramentos;
- execução de POPs;
- comparação com incidentes anteriores.

Quanto melhor a documentação disponível, mais rápido tende a ser o diagnóstico.

---

## Resolução

Após identificar a causa, executa-se a ação necessária para restabelecer o serviço.

Exemplos:

- reinicializar equipamentos;
- substituir componentes;
- corrigir configurações;
- restaurar serviços;
- atualizar software;
- corrigir cabeamento.

Sempre que possível, utilize procedimentos padronizados.

---

## Validação

Resolver tecnicamente o incidente não significa que ele esteja encerrado.

É necessário confirmar que:

- o serviço foi restabelecido;
- o usuário voltou a operar normalmente;
- não existem efeitos colaterais.

Somente após essa validação o incidente pode ser encerrado.

---

## Encerramento

Antes de finalizar o atendimento, é importante registrar:

- causa identificada;
- solução aplicada;
- evidências coletadas;
- tempo de atendimento;
- tempo de resolução;
- observações relevantes.

Esses dados servirão para futuras consultas.

---

## A importância das evidências

Um incidente bem documentado produz conhecimento.

Exemplos de evidências:

- capturas de tela;
- fotografias;
- logs;
- medições;
- comandos executados;
- configurações alteradas.

Essas informações facilitam diagnósticos semelhantes no futuro.

---

## Incidentes recorrentes

Quando o mesmo incidente ocorre repetidamente, normalmente existe um problema não resolvido.

Por exemplo:

Todos os dias um servidor apresenta indisponibilidade.

Resolver apenas o incidente diariamente não elimina sua causa.

Nesse momento torna-se necessária uma investigação mais aprofundada.

A recorrência é um importante indicador para melhoria dos processos.

---

## Comunicação durante incidentes

Manter os envolvidos informados reduz incertezas.

Boas práticas incluem:

- informar que o incidente foi identificado;
- comunicar andamento quando houver mudanças relevantes;
- registrar previsões realistas;
- informar quando o serviço for restabelecido.

Uma comunicação transparente melhora a percepção da qualidade do atendimento.

---

## Gestão de incidentes no RMEvolution SOST

No RMEvolution SOST, os incidentes podem ser tratados utilizando fluxos operacionais estruturados.

Cada atendimento registra:

- perguntas respondidas;
- evidências coletadas;
- hipóteses descartadas;
- diagnóstico confirmado;
- ações executadas;
- tempo de resolução.

Esses registros alimentam uma base de conhecimento reutilizável, permitindo que experiências obtidas em atendimentos anteriores acelerem diagnósticos futuros e contribuam para a melhoria contínua da operação.

---

## Boas práticas

Ao tratar incidentes:

- registre todas as informações relevantes;
- classifique corretamente o incidente;
- defina prioridades objetivas;
- utilize procedimentos padronizados;
- valide a solução antes de encerrar;
- registre evidências;
- analise incidentes recorrentes;
- utilize o aprendizado para melhorar processos.

Resolver rapidamente é importante.

Evitar que o mesmo incidente aconteça novamente é ainda mais valioso.

---

## Relação com os próximos conteúdos

Após estabilizar um incidente, muitas vezes torna-se necessário modificar processos, configurações ou infraestrutura para eliminar definitivamente sua causa.

Esse controle é realizado pela:

- [Gestão de Mudanças](./05 - Gestão de Mudanças.md)

Enquanto a gestão de incidentes busca restaurar rapidamente o serviço, a gestão de mudanças procura implementar alterações controladas para reduzir a ocorrência de novos incidentes.

---

## Conclusão

A gestão de incidentes organiza a resposta a eventos que afetam a operação, permitindo restaurar serviços com rapidez, registrar conhecimento e reduzir impactos para usuários e organizações.

Quando integrada a processos padronizados, documentação adequada e melhoria contínua, ela deixa de ser apenas uma atividade reativa e passa a contribuir diretamente para a evolução da qualidade operacional.