Estatísticas de drives da Backblaze em 2024
(backblaze.com)- A Backblaze comparou as taxas de falha trimestral do Q4, anual e ao longo da vida útil com base em 301.120 drives de dados entre os 305.180 drives sob gestão no fim de 2024
- A apuração do Q4 2024 considerou 300.633 discos rígidos após excluir 487 que não atendiam aos critérios, e a AFR trimestral caiu de 1,89% no Q3 para 1,35% no Q4
- Na tabela anual de 2024 restaram 298.954 drives e 27 modelos, e a AFR anual total caiu de 1,70% em 2023 para 1,57% em 2024
- Os 1.200 drives Seagate de 24TB, introduzidos no início de dezembro de 2024, não tiveram falhas até o fim do Q4, mas ficaram de fora das tabelas anual e de vida útil por falta de dias de uso suficientes
- A AFR ao longo da vida útil caiu de 1,46% em 2023 para 1,31% em 2024, com grande impacto da conclusão da migração dos drives Seagate de 4TB
Escopo da apuração e critérios de exclusão
- Em 31 de dezembro de 2024, a Backblaze gerenciava um total de 305.180 drives
- Drives de boot: 4.060
- Drives de dados: 301.120
- As estatísticas comparam a taxa anualizada de falha (AFR) dos discos rígidos usados para armazenamento de dados no Q4 2024, no acumulado de 2024 e ao longo da vida útil
- Para entrar nas tabelas e gráficos, é preciso cumprir critérios mínimos por período
- Trimestre: mais de 100 drives, mais de 10.000 drive-days
- Anual: mais de 250 drives, mais de 50.000 drive-days
- Vida útil: mais de 500 drives, mais de 100.000 drive-days
- Entre os excluídos estão drives de teste, que não são considerados drives de produção no momento, e modelos com poucos pontos de dados
- Os dados completos, incluindo drives que ficaram fora das tabelas, podem ser baixados na Drive Stats page da Backblaze
Taxa de falha de discos rígidos no Q4 2024
- A análise do Q4 2024 abrangeu 300.633 drives entre os 301.120 drives de dados, após excluir 487 que não atendiam aos critérios
- O Seagate 24TB ST24000NM002H, introduzido no início de dezembro, entrou em lote de 1.200 unidades, suficiente para preencher um Backblaze Vault, e não teve falhas até o fim do Q4
- Esse modelo entrou no grupo de capacidades acima de 20TB, junto com o Toshiba de 20TB e o WDC de 22TB
- Houve 5 modelos sem nenhuma falha no Q4
- Seagate 24TB ST24000NM002H
- HGST 4TB HMS5C4040ALE640
- Seagate 8TB ST8000NM000A
- Seagate 14TB ST14000NM000J
- Seagate 16TB ST16000NM002J
- Os modelos com 0 falhas têm número de drives e drive-days relativamente baixos, então é preciso cautela na interpretação
- A AFR total do Q4 caiu para 1,35%, ante 1,89% no Q3
- Todas as faixas de capacidade melhoraram em relação ao Q3
- Um dos principais fatores foi a adição de mais de 14.000 drives com capacidade acima de 20TB
- A AFR do grupo de drives acima de 20TB no Q4 foi de 0,77%
Troca dos drives de 4TB e transição para maior capacidade
- No Q4, o número de drives de 4TB caiu mais 1.774 unidades
- Os cerca de 4.000 drives de 4TB restantes devem desaparecer até o fim do Q1 de 2025
- Eles estão sendo substituídos por novos drives de 20TB, 22TB e 24TB
- Como apenas 1 drive de 4TB em operação falhou no Q4, os drives acima de 20TB se tornaram o grupo mais importante de observar na comparação de taxas de falha
Taxa de falha anual de 2024
- Na tabela anual de 2024, foram excluídos 9 modelos e 2.012 drives por não atenderem aos critérios
- O conjunto final ficou em 298.954 drives e 27 modelos
- Em 2024, não houve nenhum modelo com 0 falhas entre os que cumpriram os critérios
- O Seagate 16TB ST16000NM002J registrou apenas 1 falha no Q3, resultando em AFR de 0,22% em 2024
- A equipe técnica do data center instalou 53.337 drives ao longo de 2024
- Assumindo 2.080 horas de trabalho no ano, isso equivale a 26 instalações por hora
- Os 1.200 drives Seagate de 24TB adicionados em 2024 foram instalados no início de dezembro e não acumularam drive-days suficientes para entrar nas tabelas anual e de vida útil
- Os modelos que ficaram fora da tabela anual foram os seguintes
- Seagate ST8000NM000A: 247 unidades, 22.684 drive-days, AFR de 0,84% em 2024
- Seagate ST14000NM000J: 232 unidades, 19.696 drive-days, AFR de 1,32% em 2024
- Seagate ST24000NM002H: 1.200 unidades, 18.000 drive-days, AFR de 0,00% em 2024
Comparação entre 2022 e 2024 e tendência por capacidade
- A AFR anual total de 2024 foi de 1,57%, abaixo dos 1,70% de 2023
- Em 2025, a tendência é que a taxa geral de falha continue caindo, mas as faixas de capacidade que exigem atenção são diferentes
- Modelos de 8TB e 12TB: ambos já passaram de 5 anos de uso, e em geral a taxa de falha aumenta de forma perceptível após esse ponto
- Modelos de 14TB e 16TB: estão se aproximando da faixa intermediária de idade operacional, entre 3 e 5 anos, e a taxa de falha pode subir gradualmente conforme a bathtub curve
- Modelos de 20TB, 22TB e 24TB: estão entrando na fase plana da bathtub curve, em que a taxa de falha deveria ser a mais baixa
- Os drives de 4TB e 10TB tinham quantidade relativamente pequena no fim de 2024, então seu impacto na taxa geral foi limitado
- Os drives de 8TB e 12TB são modelos antigos, com 5 a 8 anos de uso
- Os de 12TB subiram de cerca de 1% de AFR em 2021 para cerca de 3% em 2024
- Os de 8TB tiveram variações trimestrais, mas a linha de tendência no mesmo período ficou quase plana
- Os drives de 14TB e 16TB representam 57% de todos os drives em operação
- A idade média deles é de 2 a 4 anos
- Esse é o período em que deveriam apresentar taxas de falha baixas e estáveis, e foi exatamente o que ocorreu
- Os drives de 22TB ainda estão em fase inicial de expansão, então a direção da AFR ficará mais clara quando o grupo se estabilizar
- A AFR atual ao longo da vida útil é de 1,06%
Tendência da taxa de falha por fabricante
- A linha de tendência do fabricante HGST não é boa, mas até o Q4 de 2023 ela estava abaixo ou próxima da média geral
- A AFR elevada da HGST em 2024 foi puxada por dois modelos de 12TB
- O HUH721212ALN604 já mostrava sinal de alta na AFR trimestral desde o Q1 de 2023
- O HUH721212ALE604 passou a mostrar comportamento parecido a partir do Q3 de 2024
- Sem esses dois modelos, a AFR da HGST em 2024 seria de 0,55%
- A linha de tendência da AFR trimestral da Seagate caiu levemente de 2,25% para 2,0% entre 2022 e 2024
- Entre os fabricantes, a Seagate foi a única a mostrar tendência de queda nesse período
- Parte dessa queda parece vir da remoção dos drives Seagate de 4TB
- A AFR trimestral dos modelos da Toshiba variou entre 0,80% e 1,52% entre 2022 e 2024
- Na maioria dos trimestres, ficou perto de 1,2%
- A maior AFR trimestral entre os modelos individuais da Toshiba foi de 1,58%
- Os modelos da WDC mostraram consistência semelhante à da Toshiba, mas com AFR menor em todos os trimestres
- Entre 2022 e 2024, a AFR trimestral dos modelos WDC variou de 0,0% a 0,85%
- No Q1 de 2022, não houve falha entre os 12.207 drives WDC em operação, resultando em AFR de 0,0%
Estatísticas ao longo da vida útil e alerta sobre backup
- Na tabela de vida útil, foram excluídos 11 modelos e 2.736 drives por não atenderem aos critérios
- O conjunto final ficou em 298.230 drives e 25 modelos
- A AFR total ao longo da vida útil caiu de 1,46% em 2023 para 1,31% em 2024
- O principal motivo da queda na AFR de vida útil foi a conclusão, em 2024, da migração dos drives Seagate de 4TB
- No fim de 2024, restavam apenas 2 drives Seagate de 4TB em operação
- Os 79 milhões de drive-days acumulados e mais de 5.600 falhas desses drives até o fim de 2023 não entraram na tabela de vida útil de 2024
- Também foi fornecida uma tabela ordenada apenas com os modelos de AFR de até 1,50%
- Os valores de AFR por modelo podem ser considerados robustos por haver dados suficientes, mas as taxas de falha de drives em geral seguem a bathtub curve e ainda existem exceções
- Há modelos que falham pouco mesmo quando envelhecem, como o HGST de 4TB
- Alguns modelos podem parecer bons e depois ter uma inflexão rápida para cima na curva de falhas
- AFR de 1% significa que 1 em cada 100 drives pode falhar em um ano
- Mesmo um usuário doméstico com apenas 1 drive pode ter exatamente esse drive falhando
- Tenha sempre backup e teste esse backup
Abertura dos dados e mudança de responsável
- O conjunto completo de dados usado para montar as tabelas e gráficos deste relatório está disponível na página Hard Drive Test Data
- Os dados podem ser baixados e usados gratuitamente
- Ao usar, é preciso creditar a Backblaze como fonte
- A responsabilidade pela forma de uso dos dados é do usuário
- Os dados em si não podem ser vendidos
- A pessoa responsável por escrever os relatórios Drive Stats nos últimos 10 anos vai se aposentar após este relatório
- A partir do relatório do Q1 de 2025, Stephanie Doyle e David Johnson assumirão a continuidade do Drive Stats
1 comentários
Opiniões no Hacker News
É quase inacreditável perceber que venho lendo os relatórios Drive Stats de forma constante nos últimos 10 anos
Dados antes da ação não têm valor intrínseco e, mesmo depois da ação, não garantem o resultado desejado. Agradeço por 10 anos de ótimas estatísticas e lições, e espero que a aposentadoria traga muitos “resilvering” divertidos
Não é uma best practice, mas nos últimos 10 anos rodei meu servidor doméstico com um drive pequeno e rápido para o SO e um único disco de grande capacidade escolhido com base no Backblaze Drive Stats, e ainda não tive falhas
Confio na metodologia da Backblaze e considero um material muito valioso do ponto de vista do consumidor. Meu drive mais recente foi um WDC WUH722222ALE6L4 de 22TiB e, embora haja apenas alguns meses de dados, a tendência geral da WDC neste relatório me deixa tranquilo de que ele deve aguentar até o próximo ciclo de substituição
Vejo com frequência relatos online de várias unidades compradas do mesmo lote que falharam. Não conheço o padrão de aquisição da Backblaze, então não posso provar, mas comprei um ST16000NM001G, que aparecia entre os melhores da lista, e ele falhou em menos de um ano. Com discos rígidos ou armazenamento, é melhor se preparar para downtime com RAID por software e backup, e torcer para que a falha ocorra dentro do período de garantia
Mesmo que uma confiabilidade maior reduza o custo total de propriedade, se o efeito for no máximo em torno de 10%, ele acaba sendo compensado pela ausência de descontos nos drives “melhores”. O problema de uma anedota com n=1 é que não dá para saber se foi resultado de seguir um bom conselho ou apenas sorte
O marketing de discos ainda usa unidades decimais, enquanto TiB é uma unidade binária. 22TB são cerca de 20TiB
Nesse caso, três WUH721414ALE6L4 recondicionados saem por um preço total parecido. Colocando-os em RAIDZ1, você obtém 28TB e chega perto do nível de confiabilidade que se poderia esperar dentro de um único dispositivo. Claro que backup continua sendo importante, mas isso é outro assunto
Aqui, “de alguma forma” pode significar tanto hardware quanto software
Nos últimos 24 meses, usei 17 drives Seagate ST12000NM001G 12TB SATA em um pool raidz3 grande, e minhas estatísticas pessoais, considerando os 3 ou 4 primeiros caracteres do número de série, foram estas: ZLW2 teve 5 falhas em 8 unidades, ZL2 teve 1 em 4, ZS80 teve 1 em 2, ZTN teve 0 em 2, e ZLW0 teve 0 em 1
Todos eram drives recondicionados; 2 foram comprados na loja da Seagate no eBay, e o restante na ServerPartDeals. Dos 15 comprados na ServerPartDeals, 7 falharam, e pelo menos 4 deles falharam em até 6 semanas após a instalação. Usei as estatísticas da Backblaze como referência ao escolher os drives para montar o pool de armazenamento inicial e, toda vez que as estatísticas atualizadas chegam na minha caixa de entrada, confiro a tabela e volto a verificar se meus drives são mesmo os 001G para os quais a Backblaze indicou uma taxa anual de falha de 0,99%. No fim, os resultados podem variar de pessoa para pessoa
Antigamente eu achava essas estatísticas interessantes e úteis para minha próxima compra de HDD, mas acabei percebendo que, no fim, eu as usava apenas para escolher uma marca com confiabilidade recente razoável
Agora existem basicamente só 3 marcas, e as estatísticas são em sua maioria de modelos antigos, então o principal uso é quando se compra um drive usado do mesmo lote que a Backblaze por acaso usou. É melhor comprar 2 unidades de vendedores diferentes e montar um RAID, ou fazer backups offsite regulares
Idealmente, é melhor usar RAID por software ou um sistema de arquivos com scrubbing e recuperação para detectar bit rot. Ou então uma solução de hardware que faça a mesma coisa e consiga informar a correção de erros ao SO. Como sempre, soluções do tipo RAID servem principalmente para aumentar a disponibilidade; backup é uma questão totalmente diferente. Nada supera muitas cópias em vários locais
Olhando os números da WDC e da Toshiba, é difícil contestar, e em comparação os números da Seagate são bem constrangedores
Os drives HGST eram ótimos, mas hoje são drives legados pertencentes à WDC. Já fazem parte da WD há bastante tempo, e os modelos novos saem com a marca WDC
https://www.heise.de/en/news/Hard-disk-fraud-Increasing-evid...
Quando comecei meu NAS de 24 baias atual, há mais de 10 anos, decidi quais drives comprar olhando as estatísticas de drives da Backblaze, que estavam começando a sair na época. A escolha foram drives HGST de 4TB e 7200rpm
Pelas minhas estatísticas pessoais à la Louwrentius, tive 0 falhas de drive em mais de 10 anos. Enquanto isso, soube que Andy Klein, autor do Backblaze Drive Stats, vai se aposentar; desejo tudo de bom e agradeço. Além disso, é impressionante pensar que os dados do meu NAS com 24 drives agora cabem em dois drives modernos de 32TB
A Backblaze é um dos serviços mais respeitados no setor de armazenamento, e meu respeito por ela continuou crescendo mesmo depois que lancei minha própria solução de armazenamento em nuvem
Depois que alguns discos rígidos falharam no meu antigo NVR, percebi que o calor é o maior inimigo dos discos rígidos
Aquele NVR esquentava muito porque alimentava câmeras PoE, fazia transcodificação de vídeo e gravava continuamente nos discos. Provavelmente o calor empenou os discos e fez as cabeças colidirem com a superfície, causando perda de dados. No novo NVR, separei a alimentação PoE para um switch alimentado, a nova CPU cuida da codificação de vídeo por hardware, uso SSD para a gravação primária e deixei os discos rígidos como backup secundário. O calor caiu bastante e, até agora, está funcionando bem. Sei que regravar continuamente no SSD não é ideal, mas, olhando o tempo médio até a falha de um SSD, ele deve levar alguns anos para falhar, então é um risco aceitável
Mesmo drives HGST de datacenter ficam em torno de 5,5 W em média, com potência de projeto térmico na faixa de 7,8 W sob carga máxima. Não é difícil projetar um gabinete que resfrie 6 a 8 discos rígidos fazendo o ar passar por eles com uma ventoinha DC de 12 V, de 120 mm ou 140 mm, relativamente lenta e silenciosa. Mesmo ao usar como NAS um gabinete mid-tower de PC desktop com uma CPU de baixo consumo, muitas vezes basta uma única ventoinha traseira de 140 mm puxando o ar da frente para trás para resfriar adequadamente 8 HDDs de 3,5 polegadas. Ainda assim, os projetistas de equipamentos continuam espremendo tudo em espaços pequenos demais e deixando a ventilação insuficiente
Todo ano, este relatório parece uma excelente ação de promoção de marca da Backblaze voltada a potenciais clientes técnicos, e também presta um bom serviço ao setor
Fico curioso para saber que outros exemplos parecidos existem em outras empresas, além de código open source
Dito isso, os posts de estatísticas de drives da Backblaze exigem muito mais trabalho e têm um padrão de qualidade bem mais alto do que o comum nessa tática
https://www.techempower.com/benchmarks/#hw=ph&test=fortune&s...
Os desmontes da iFixIt também são um conteúdo informativo bem bom: https://www.ifixit.com/Teardown
Há também as tomografias da Lumafield: https://www.scanofthemonth.com/
Também há benchmarks de hardware: https://benchmark.clickhouse.com/hardware/ — isso também é usado pela Phoronix
Há sinais disso aqui e ali, mas ainda é divertido fazer por conta própria, e estamos expandindo para Networking Stats e outros conteúdos futuros. Também pretendemos abordar como essas estatísticas se refletem na implantação da infraestrutura, então deve sair algo interessante
É bom ver isso todo ano. Mas, mesmo sabendo que é gratuito, se eu tivesse uma pequena ressalva, seria querer ver também métricas de uso real, não apenas “estava ligado”
Sem saber por quanto tempo e com que frequência os drives foram usados — por exemplo, contagens de leitura/escrita ou bytes/segundo —, a taxa anual de falhas de HDDs perde parte do sentido. Se todos os drives ficaram com 99% de uso durante o ano inteiro, aí seria compreensível
A Backblaze chega a ter que considerar se deve continuar usando drives menores por causa do tempo de reconstrução e porque drives de maior densidade não aguentam tanta pancada