Alta Disponibilidade –Terminologia (II)

Interrupção planeada


Interrupções planeadas incluem a manutenção, backups offline e actualizações. Estas muitas vezes podem ser agendadas fora dos períodos de alta disponibilidade, quando é necessário.

 

Interrupções não planeadas


Embora as interrupções planeadas sejam um mal necessário, uma interrupção não planeada pode ser um verdadeiro pesadelo para um negócio. Dependendo do negócio em questão e da duração do tempo de inactividade, uma interrupção não planeada pode resultar em perdas tão avassaladoras que a empresa seja forçada a fechar. Independentemente da sua natureza, as interrupções são algo que as empresas normalmente não toleram. Há sempre pressão sobre a TI para eliminar totalmente estas paragens não planeadas e de reduzir drasticamente, se não eliminar, o tempo de inactividade planeado.

Note-se que uma aplicação ou sistema de computador não precisa estar totalmente em baixo para se considerar inactivo. É possível que o desempenho de uma aplicação se degrade de tal forma que é inútil. Do ponto de vista do utilizador empresarial ou final está em baixo, embora esteja disponível.

As paragens não planeadas podem ter várias causas e podem ser categorizadas em:
  • Falhas de Hardware - Falha de componentes principais sistemas, tais como processadores e memória ou periféricos, discos, controladores de disco, placas de rede, ou equipamentos auxiliares, tais como módulos de alimentação e ventiladores, e equipamentos de rede, como switches, hubs, cabos, etc, podem ser as causas de falhas de hardware.
  •  Falhas de Software - As possibilidades de falha de software dependem principalmente do tipo de software utilizado. Uma das principais causas de falha de software é aplicar um patch. Às vezes, se um patch não corresponde ao tipo de aplicação, o software aplicacional pode começar a comportar-se de maneira estranha, trazendo para baixo a aplicação e revertendo as alterações, se possível. Às vezes, uma actualização também pode causar um problema. Os principais problemas com as actualizações serão relacionados com o desempenho ou o comportamento inadequado de qualquer produto de terceiros, que depende dos upgrades.
  • Erros Humanos - Uma acção acidental de qualquer utilizador pode causar uma falha grave no sistema. Apagar um ficheiro necessário, apagar os dados ou uma tabela, actualizando a base de dados com um valor errado, etc, são alguns exemplos.

 

Alta Disponibilidade - Terminologia (I)


Alguns dos termos foram traduzidos de forma livre numa tentativa de transmitir as correctas noções que lhe estão subjacentes. Noutros casos, embora tenham sido traduzidos os significados, as siglas mantêm-se no inglês porque é sempre assim que surgem na literatura especializada.

Sistema


Um sistema é composto por uma colecção de componentes interactivos. Um componente pode ele próprio ser um sistema, ou pode ser apenas um componente singular. Os componentes são o resultado da decomposição do sistema, principalmente motivada para assistir na separação de sistemas complexos por razões técnicas, ou muitas vezes, por razões organizacionais ou de negócios. A decomposição de sistemas em componentes é um exercício recursivo e os componentes são geralmente delineados pela especificação cuidadosa das suas entradas e saídas.

Serviço


Um sistema fornece um ou mais serviços aos seus consumidores. Um serviço é a saída de um sistema que corresponde à especificação para a qual o sistema foi elaborado, ou que está de acordo com a percepção que os utilizadores do sistema têm de quais devem ser os valores correctos.

Falha


Uma falha num sistema ocorre quando o consumidor (humano ou não humano) de um serviço é afectado pelo facto de o sistema não ter entregue o serviço esperado. As falhas são resultados incorrectos em relação a uma especificação ou um comportamento inesperado percebido pelo consumidor ou utilizador de um serviço. A causa de uma falha é considerada um defeito.

Tempo Médio Para Falha


A fiabilidade do hardware pode ser prevista pela análise estatística dos dados históricos. Quanto mais tempo um componente funciona, mais é provável que falhe devido ao envelhecimento. O Tempo Médio Para Falha (Mean Time to Failure - MTTF) de um componente é apenas isso: uma previsão estatística que mede o tempo médio entre falhas assumindo um modelo teórico no qual o sistema que falhou não é reparado. Quanto maior o MTTF de um componente, menos provável é a sua falha. O MTTF de um componente (se for conhecido) pode usar como informação útil para o estabelecimento de procedimentos de manutenção preventiva e o seu valor global num sistema pode ser melhorado através de uma cuidadosa selecção de hardware e software.

MTTF
O MTTF é o número total de horas de serviço de todos os dispositivos dividido peolo número total de dispositivos.

Alta Disponibilidade - Introdução

Definição de Alta Disponibilidade


Alta Disponibilidade (AD) é a capacidade de um sistema para executar a sua função de forma contínua (sem interrupção) por um período de tempo significativo e superior ao que a fiabilidade dos seus componentes individuais poderia sugerir. Então, a AD é um equilíbrio entre o custo da inactividade e o custo das medidas de protecção que estão disponíveis para evitar ou reduzir o tempo dessa mesma inactividade.

O termo Alta Disponibilidade, quando aplicado a sistemas informáticos, significa que a aplicação ou serviço em questão está permanentemente disponível, independentemente da hora do dia, local ou outros factores que possam influenciar a disponibilidade de tal recurso.

Em geral, a AD é a capacidade de continuar o serviço por períodos muito longos sem interrupções. Assim, AD é uma abordagem ao planeamento e implementação de sistemas e dos serviços a eles associados, que assegura um nível de desempenho operacional previamente combinado será cumprido durante um período de medição contratual.

Os sistemas de AD devem proteger as empresas de dois tipos de possíveis falhas: falhas no sistema e falhas do site. Embora as verdadeiras soluções AD devam proteger contra estes dois tipos de falhas, os sistemas AD são normalmente considerados como os que tratam da protecção contra as falhas no sistema, enquanto as falhas no site são normalmente tratadas por um sistema de Disaster Recovery (DR).