Entendo encontrar humor nesse desastre, mas fico me perguntando: e a responsabilização?
Vi algumas vezes no HN comentários dizendo que esse incidente causou bilhões de dólares em prejuízos, mas ainda não vi muita coisa sobre processos
Será que a licença é tão blindada assim que os clientes não têm como obter reparação? Dá para entender no caso de um consumidor cujo PC pessoal ficou parado por algumas horas/dias, mas não faz sentido a indústria aceitar esse nível de exposição a risco
Um dos grandes motivos pelos quais a engenharia civil é vista como uma área séria é justamente esse. Se uma ponte desaba, há não só responsabilidade financeira, mas também a possibilidade de responsabilidade criminal, e estudantes de engenharia civil aprendem repetidamente que podem ir para a cadeia se agirem de forma antiética ou assumirem riscos inaceitáveis como engenheiros
Será que engenheiros de software têm algum caminho para chegar a esse nível de responsabilidade e normas de prática profissional?
A engenharia civil é diferente porque projeta produtos físicos. Nada é projetado exatamente no limite; tudo recebe uma margem de segurança suficiente
É como calcular uma ponte cheia de caminhões passando durante um furacão enquanto também ocorre um terremoto, e então acrescentar mais 20%. Se você não tem certeza de que uma viga vai aguentar, basta fazê-la maior; se o cálculo estiver 0,5% errado, não é um grande problema
Se houver um erro de digitação nos documentos de projeto e tentarem colocar uma viga de 150 pés em um vão de 15,0 pés, o construtor vai pedir confirmação. Por isso, o desabamento de uma ponte quase certamente é resultado de negligência grave
Já em programação, um único < no lugar de <= pode ser a diferença entre tudo estar funcionando e bilhões de dólares em prejuízo. Nenhum programador na Terra consegue escrever uma aplicação de complexidade não trivial com 100% de ausência de defeitos
Até o microkernel seL4, que se apoia em provas formais de correção, tem bugs. Compiladores e verificadores de prova são tecnicamente possíveis, mas não reclamam quando você manda fazer algo obviamente errado
Aceitar responsabilidade praticamente ilimitada até pelo menor erro não é algo que uma pessoa normal aceitaria
Se quisermos responsabilizar engenheiros de software, primeiro é preciso encontrar uma forma de distinguir erros cotidianos de boa-fé de negligência grave, e formalizar isso seria extremamente difícil
Quando a Delta ameaçou processar por perdas de US$ 500 milhões, a CrowdStrike respondeu publicamente que, pelo contrato, o limite de responsabilidade da CrowdStrike era de milhões de dólares em um dígito
Em seguida, enviou uma lista dizendo que, se o processo começasse, exigiria na fase de descoberta de provas planos de backup, planos de failover, cronogramas e resultados de testes, quando foi o último exercício de recuperação de backup etc.
Na prática, quis dizer: “se processarem, vamos vasculhar suas práticas de TI com profundidade suficiente para deixá-los mais constrangidos do que nós e mostrar que a culpa foi de vocês”
Há meios de reparação, mas, como foi dito, não são para pessoas comuns. Empresas estão processando a CrowdStrike e continuarão fazendo isso; pelos documentos divulgados pela CrowdStrike, parece muito provável que as empresas afetadas vençam
Parece bastante provável que elas consigam convencer um juiz, júri ou árbitro de que a CrowdStrike cometeu negligência grave e causou claramente prejuízos diretos e danos indiretos à reputação das empresas
Sinceramente, nem sei se a CrowdStrike vai brigar até o fim. A maioria dos casos deve ser resolvida em acordo fora dos tribunais, e talvez vejamos a CrowdStrike desmoronar ao longo dos próximos anos
Muitas empresas têm seguro para incidentes que interrompem suas fontes de receita. Assim como agricultores têm seguro agrícola ou grandes varejistas têm seguro contra desastres, imagino que exista algo para situações em que uma falha de infraestrutura zera a receita por um período
Mesmo que todos os afetados cobrem 100% das perdas da ClownStrike, a receita da ClownStrike não conseguiria cobrir esses prejuízos. Mesmo que você quisesse fechar a empresa, não conseguiria recuperar um valor próximo ao prejuízo real
Então fico curioso sobre o que, na prática, seria proposto. Código sem bugs é praticamente impossível, e alguns riscos são aceitos pelo usuário
Você realmente acha que um software precisa estar 100% livre de bugs antes de ser usado? Como provaria isso? E a pergunta seguinte é: quão limpo é o seu próprio código para você achar que isso é possível?
É possível, mas a resposta é tempo. A engenharia civil tem milhares de anos de história; a engenharia de software é muito mais jovem, e até os fundamentos da área ainda estão mudando
Pelo menos no meu país, desde o fim dos anos 1970 houve projetos de lei para licenciar analistas de sistemas, programadores de computadores eletrônicos, operadores de máquinas de processamento de dados e datilógrafos(!)
Se essas leis tivessem sido aprovadas, o desenvolvimento de software no nosso país teria ficado décadas para trás. Por exemplo, um dos projetos queria permitir a “operação e o uso de dispositivos ou máquinas de processamento eletrônico, incluindo terminais (digitais ou visuais)” apenas a quem tivesse licença de “operador de máquina de processamento de dados”
Esse problema vai além da CrowdStrike: ele mostra toda uma abordagem de segurança em que empresas compram produtos de segurança prontos para satisfazer reguladores e seguradoras, sem se importar de fato com o que eles fazem e como funcionam
Não estou dizendo que tecnologia não deva ser regulada, mas o modelo atual de “vamos comprar isso para tirar a responsabilidade das nossas costas” não funciona
O pior é que as pessoas que previram esse tipo de coisa, ou seja, os departamentos de TI, provavelmente não puderam fazer nada. É bem provável que a alta direção tenha tornado isso obrigatório por causa de requisitos de “seguro cibernético” ou outras normas. É uma loucura
Vi muitos bons profissionais de TI se sentindo assim, mas, pela minha experiência, a maioria dos departamentos de TI não se importava muito se algo realmente resolvia o problema, desde que atendesse ao item exigido no contrato
Em um emprego anterior, um software parecido com o da CrowdStrike foi instalado na minha estação de trabalho durante o fim de semana e, quando voltei, o tempo de compilação estava 20% mais lento
Eu estava medindo isso na época, então tinha dezenas de medições, e mostrei por rastreamento de ETL que o software era a causa, mas a TI não reconheceu. O contrato do fornecedor dizia que não haveria impacto de desempenho na nossa carga de trabalho
A maioria dos departamentos de TI provavelmente não previu isso, e é natural que não tenham montado toda a estratégia de segurança em torno dessa possibilidade. Não sei de onde vem essa narrativa
O Falcon oferecia, e ainda oferece, benefícios reais e concretos de segurança aos clientes. Isso não significa que elimine todos os riscos, nem que não crie riscos próprios
Como em qualquer problema de engenharia, é literalmente um jogo de trade-offs. Isso não deveria ser estranho para as pessoas aqui
De repente, o HN ficou cheio de especialistas em segurança tomados por viés retrospectivo e viés de evento recente, explicando como as empresas poderiam ter desviado dessa bala, mas sem considerar as balas reais das quais elas já estavam se desviando justamente por usar o Falcon
Isso é algo que poderia ser usado como prova em tribunal ou em um processo, não é engraçado
Originalmente, provavelmente teria sido um momento fechado, uma conversa entre nerds de segurança, mas agora acabou sendo exposto para que o público em geral, que sofreu grandes prejuízos, possa zombar à vontade
Não achei de forma alguma que o executivo da CrowdStrike tenha tratado a situação levianamente. Pelo contrário, aquele discurso pareceu levar a situação a sério, reconhecer que foi um erro enorme e aceitar aquele troféu como uma marca de vergonha e como um alerta para futuros funcionários da CrowdStrike
Acho que aceitar esse prêmio foi uma atitude realmente digna por parte desse executivo. Claro, dizer isso não significa, de forma alguma, que a CrowdStrike fique isenta de responsabilidade pelo incidente ou de responsabilidade por indenizações
Poderia ser engraçado em uma camiseta
When I use
REGEXP
I use it in my
KERNEL CODE
Tragédia e comédia são dois lados da mesma moeda
Problemas de segurança de computadores já apareciam na época da Guerra do Vietnã, e os EUA de fato trabalharam para encontrar um modelo eficaz de segurança computacional. Só que vivemos em uma sociedade que praticamente apagou isso da memória
Por que um scanner precisa rodar 24 horas por dia, 365 dias por ano, acima de tudo que o computador tenta executar?
Por que o sistema operacional precisa depender de autoridade periférica?
Culpar a CrowdStrike só desvia a atenção das falhas fundamentais de design que ignoramos todos os dias em sistemas operacionais como Linux, MacOS e Windows
Ainda estão culpando a Microsoft, mas não é impossível executar o código que é atualizado fora do kernel e usar código em modo kernel apenas para observação e ação, não para lógica
Trabalho em TI e fui o coitado que estava de sobreaviso justamente quando a Clown Strike derrubou a maior parte da infraestrutura
Pessoalmente, é bem provável que tenhamos nos recuperado em algumas horas, em vez de alguns dias, porque eu bati o pé para não usar baboseira baseada em nuvem
Fico bastante preocupado que, como gente do tipo diretor de TI não vê isso como um problema e não toma nenhuma medida para impedir esse tipo de besteira, em breve vamos acabar lidando com outra grande pane baseada em nuvem
Já estou cansado de repetir que “só idiotas dependem do computador dos outros”, e concordo 100% com isso
É estranho haver gerentes ou executivos que entendem por que um ponto único de falha na infraestrutura interna é ruim, mas acham aceitável que produtos e serviços de fornecedores externos virem um ponto único de falha
Parece que, ao assinar um contrato e pagar, eles passam a acreditar que aquilo é criado e mantido por super-humanos que não cometem erros, ao contrário dos engenheiros internos. Não entendo essa confiança equivocada
Concordo 100%. Além disso, é surpreendente ver quanto se paga por serviços de nuvem como Azure VD
Com apenas uma parte do orçamento anual de nuvem, a empresa poderia construir por conta própria uma infraestrutura muito estável e capaz de funcionar offline
Seu tom soa muito agressivo. Mesmo que você esteja certo, acho que eu não gostaria de trabalhar com você
Talvez você conseguisse transmitir melhor o ponto se não falasse de forma tão agressiva
Não há muito a fazer quando CTOs idiotas aceitam conselhos de cúpulas de CTOs, de consultores com incentivos distorcidos e de todo tipo de conferência aleatória
A maioria dos vencedores anteriores de “falha mais épica” foi naturalmente dominada pela Microsoft
Dá para continuar passando a vergonha adiante, mas, se você acredita que essa pane em produção foi causada por processos ruins, a Microsoft claramente também teve um papel importante aqui
Depois dessa bagunça toda, eu realmente me pergunto como o CEO e o CTO ainda estão nos cargos
O 911 ficou fora do ar em várias cidades e o fluxo dos hospitais ficou lento a ponto de praticamente travar, mas eles têm tempo para ir à Defcon e fazer piada?
Ainda há hospitais que não conseguiram consertar os computadores? Claro que a CS estragou tudo, mas, além de pagar indenizações e mudar os processos, não sei o que mais dá para fazer agora
Alertar as pessoas para que não repitam o mesmo erro não me parece um mau uso do tempo
É correto culpar a CS aqui, mas acho que colocar a CS em sistemas críticos como o 911 já foi, por si só, um grande erro
Só que a pessoa que fez isso provavelmente sabia que poderia escapar da responsabilidade, então imagino que não tivesse motivo para se importar
1 comentários
Opiniões no Hacker News
Entendo encontrar humor nesse desastre, mas fico me perguntando: e a responsabilização?
Vi algumas vezes no HN comentários dizendo que esse incidente causou bilhões de dólares em prejuízos, mas ainda não vi muita coisa sobre processos
Será que a licença é tão blindada assim que os clientes não têm como obter reparação? Dá para entender no caso de um consumidor cujo PC pessoal ficou parado por algumas horas/dias, mas não faz sentido a indústria aceitar esse nível de exposição a risco
Um dos grandes motivos pelos quais a engenharia civil é vista como uma área séria é justamente esse. Se uma ponte desaba, há não só responsabilidade financeira, mas também a possibilidade de responsabilidade criminal, e estudantes de engenharia civil aprendem repetidamente que podem ir para a cadeia se agirem de forma antiética ou assumirem riscos inaceitáveis como engenheiros
Será que engenheiros de software têm algum caminho para chegar a esse nível de responsabilidade e normas de prática profissional?
É como calcular uma ponte cheia de caminhões passando durante um furacão enquanto também ocorre um terremoto, e então acrescentar mais 20%. Se você não tem certeza de que uma viga vai aguentar, basta fazê-la maior; se o cálculo estiver 0,5% errado, não é um grande problema
Se houver um erro de digitação nos documentos de projeto e tentarem colocar uma viga de 150 pés em um vão de 15,0 pés, o construtor vai pedir confirmação. Por isso, o desabamento de uma ponte quase certamente é resultado de negligência grave
Já em programação, um único
<no lugar de<=pode ser a diferença entre tudo estar funcionando e bilhões de dólares em prejuízo. Nenhum programador na Terra consegue escrever uma aplicação de complexidade não trivial com 100% de ausência de defeitosAté o microkernel seL4, que se apoia em provas formais de correção, tem bugs. Compiladores e verificadores de prova são tecnicamente possíveis, mas não reclamam quando você manda fazer algo obviamente errado
Aceitar responsabilidade praticamente ilimitada até pelo menor erro não é algo que uma pessoa normal aceitaria
Se quisermos responsabilizar engenheiros de software, primeiro é preciso encontrar uma forma de distinguir erros cotidianos de boa-fé de negligência grave, e formalizar isso seria extremamente difícil
Em seguida, enviou uma lista dizendo que, se o processo começasse, exigiria na fase de descoberta de provas planos de backup, planos de failover, cronogramas e resultados de testes, quando foi o último exercício de recuperação de backup etc.
Na prática, quis dizer: “se processarem, vamos vasculhar suas práticas de TI com profundidade suficiente para deixá-los mais constrangidos do que nós e mostrar que a culpa foi de vocês”
Parece bastante provável que elas consigam convencer um juiz, júri ou árbitro de que a CrowdStrike cometeu negligência grave e causou claramente prejuízos diretos e danos indiretos à reputação das empresas
Sinceramente, nem sei se a CrowdStrike vai brigar até o fim. A maioria dos casos deve ser resolvida em acordo fora dos tribunais, e talvez vejamos a CrowdStrike desmoronar ao longo dos próximos anos
Mesmo que todos os afetados cobrem 100% das perdas da ClownStrike, a receita da ClownStrike não conseguiria cobrir esses prejuízos. Mesmo que você quisesse fechar a empresa, não conseguiria recuperar um valor próximo ao prejuízo real
Então fico curioso sobre o que, na prática, seria proposto. Código sem bugs é praticamente impossível, e alguns riscos são aceitos pelo usuário
Você realmente acha que um software precisa estar 100% livre de bugs antes de ser usado? Como provaria isso? E a pergunta seguinte é: quão limpo é o seu próprio código para você achar que isso é possível?
Pelo menos no meu país, desde o fim dos anos 1970 houve projetos de lei para licenciar analistas de sistemas, programadores de computadores eletrônicos, operadores de máquinas de processamento de dados e datilógrafos(!)
Se essas leis tivessem sido aprovadas, o desenvolvimento de software no nosso país teria ficado décadas para trás. Por exemplo, um dos projetos queria permitir a “operação e o uso de dispositivos ou máquinas de processamento eletrônico, incluindo terminais (digitais ou visuais)” apenas a quem tivesse licença de “operador de máquina de processamento de dados”
Esse problema vai além da CrowdStrike: ele mostra toda uma abordagem de segurança em que empresas compram produtos de segurança prontos para satisfazer reguladores e seguradoras, sem se importar de fato com o que eles fazem e como funcionam
Não estou dizendo que tecnologia não deva ser regulada, mas o modelo atual de “vamos comprar isso para tirar a responsabilidade das nossas costas” não funciona
O pior é que as pessoas que previram esse tipo de coisa, ou seja, os departamentos de TI, provavelmente não puderam fazer nada. É bem provável que a alta direção tenha tornado isso obrigatório por causa de requisitos de “seguro cibernético” ou outras normas. É uma loucura
Em um emprego anterior, um software parecido com o da CrowdStrike foi instalado na minha estação de trabalho durante o fim de semana e, quando voltei, o tempo de compilação estava 20% mais lento
Eu estava medindo isso na época, então tinha dezenas de medições, e mostrei por rastreamento de ETL que o software era a causa, mas a TI não reconheceu. O contrato do fornecedor dizia que não haveria impacto de desempenho na nossa carga de trabalho
O Falcon oferecia, e ainda oferece, benefícios reais e concretos de segurança aos clientes. Isso não significa que elimine todos os riscos, nem que não crie riscos próprios
Como em qualquer problema de engenharia, é literalmente um jogo de trade-offs. Isso não deveria ser estranho para as pessoas aqui
De repente, o HN ficou cheio de especialistas em segurança tomados por viés retrospectivo e viés de evento recente, explicando como as empresas poderiam ter desviado dessa bala, mas sem considerar as balas reais das quais elas já estavam se desviando justamente por usar o Falcon
Isso é algo que poderia ser usado como prova em tribunal ou em um processo, não é engraçado
Originalmente, provavelmente teria sido um momento fechado, uma conversa entre nerds de segurança, mas agora acabou sendo exposto para que o público em geral, que sofreu grandes prejuízos, possa zombar à vontade
Acho que aceitar esse prêmio foi uma atitude realmente digna por parte desse executivo. Claro, dizer isso não significa, de forma alguma, que a CrowdStrike fique isenta de responsabilidade pelo incidente ou de responsabilidade por indenizações
When I use
REGEXP
I use it in my
KERNEL CODE
Tragédia e comédia são dois lados da mesma moeda
Via xcancel: https://xcancel.com/singe/status/1822324795645575263
Problemas de segurança de computadores já apareciam na época da Guerra do Vietnã, e os EUA de fato trabalharam para encontrar um modelo eficaz de segurança computacional. Só que vivemos em uma sociedade que praticamente apagou isso da memória
Por que um scanner precisa rodar 24 horas por dia, 365 dias por ano, acima de tudo que o computador tenta executar?
Por que o sistema operacional precisa depender de autoridade periférica?
Culpar a CrowdStrike só desvia a atenção das falhas fundamentais de design que ignoramos todos os dias em sistemas operacionais como Linux, MacOS e Windows
Ainda estão culpando a Microsoft, mas não é impossível executar o código que é atualizado fora do kernel e usar código em modo kernel apenas para observação e ação, não para lógica
Trabalho em TI e fui o coitado que estava de sobreaviso justamente quando a Clown Strike derrubou a maior parte da infraestrutura
Pessoalmente, é bem provável que tenhamos nos recuperado em algumas horas, em vez de alguns dias, porque eu bati o pé para não usar baboseira baseada em nuvem
Fico bastante preocupado que, como gente do tipo diretor de TI não vê isso como um problema e não toma nenhuma medida para impedir esse tipo de besteira, em breve vamos acabar lidando com outra grande pane baseada em nuvem
Já estou cansado de repetir que “só idiotas dependem do computador dos outros”, e concordo 100% com isso
Parece que, ao assinar um contrato e pagar, eles passam a acreditar que aquilo é criado e mantido por super-humanos que não cometem erros, ao contrário dos engenheiros internos. Não entendo essa confiança equivocada
Com apenas uma parte do orçamento anual de nuvem, a empresa poderia construir por conta própria uma infraestrutura muito estável e capaz de funcionar offline
Talvez você conseguisse transmitir melhor o ponto se não falasse de forma tão agressiva
Lista de vencedores anteriores do Pwnie Award para comparação: https://en.wikipedia.org/wiki/Pwnie_Awards
Dá para continuar passando a vergonha adiante, mas, se você acredita que essa pane em produção foi causada por processos ruins, a Microsoft claramente também teve um papel importante aqui
Depois dessa bagunça toda, eu realmente me pergunto como o CEO e o CTO ainda estão nos cargos
O 911 ficou fora do ar em várias cidades e o fluxo dos hospitais ficou lento a ponto de praticamente travar, mas eles têm tempo para ir à Defcon e fazer piada?
Alertar as pessoas para que não repitam o mesmo erro não me parece um mau uso do tempo
Só que a pessoa que fez isso provavelmente sabia que poderia escapar da responsabilidade, então imagino que não tivesse motivo para se importar