Categorias
Big Data Ciência de Dados Eventos

6 eventos de Ciência de Dados e tecnologia que serão destaque no Brasil em 2025

A Ciência de Dados continua em expansão acelerada, conectando profissionais e pesquisadores de diversas áreas. Em 2025, o Brasil será palco de eventos relevantes que abordam tanto a evolução tecnológica quanto os desafios enfrentados por setores específicos. Confira a lista com sete eventos que prometem movimentar o cenário da ciência de dados e áreas correlatas.

 

 

Oil & Gas Summit – Margem Equatorial e Transição Energética

  • Local: Fortaleza – Ceará
  • Data: 19 a 21 de março

A 1ª edição do Oil & Gas Summit: Margem Equatorial e Transição Energética será realizada no Centro de Eventos do Ceará, Fortaleza-CE, e terá como parceiros e apoiadores a Universidade Federal do Ceará (UFC), a Secretaria do Desenvolvimento Econômico do Governo do Estado do Ceará, a Assembleia Legislativa do Estado do Ceará (ALECE), o Sindi Energia Ceará e o Insight Data Science Lab.

Com a previsão de atrair mais de 50 mil visitantes, o Oil & Gas Summit será um ponto de convergência entre o setor público e privado, pois reunirá líderes, especialistas e stakeholders do mercado e acadêmicos para debater a integração do Norte e Nordeste ao setor de petróleo, gás e energias renováveis. 

Ao longo dos três dias do evento, os especialistas convidados vão explorar por meio de painéis, exposições e palestras o potencial dessas regiões em se tornarem centros estratégicos de desenvolvimento industrial. O debate incluirá temas como geração de empregos, diversificação da matriz energética e a exploração de fontes como energia solar, eólica e o Hidrogênio Verde (H2V).

O Oil & Gas Summit será um dos eventos mais importantes de 2025 para pesquisadores e estudantes de ciência de dados, já que se concentra na interseção entre tecnologia e sustentabilidade. O summit irá explorar como a ciência de dados e as tecnologias emergentes estão contribuindo para o desenvolvimento de formas de exploração mais seguras e eficientes de recursos naturais, enquanto aborda os desafios da transição energética. Com especialistas discutindo desde a previsão de demanda energética até a análise de dados geofísicos, o evento unirá indústria e a pesquisa acadêmica.

 

Simpósio Brasileiro de Banco de Dados –

SBBD 2025 

  • Local: Fortaleza – Ceará
  • Data: Outubro de 2025

O Simpósio Brasileiro de Banco de Dados (SBBD) é a maior conferência da América Latina em Big Data, Engenharia de Dados e Ciência de Dados, promovida pela Sociedade Brasileira de Computação desde 1986. O evento reúne estudantes, pesquisadores e profissionais para debater avanços científicos e soluções inovadoras relacionadas ao manuseio e à análise de dados, com foco em aplicações como modelos de Inteligência Artificial.

Entre os destaques do SBBD estão:

  • Apresentação de pesquisas em sessões técnico-científicas que fomentam avanços em ciência básica e aplicada.
  • Concurso de Teses e Dissertações que premia trabalhos de excelência de estudantes de mestrado e doutorado.
  • Workshops para discussão de projetos de pós-graduação em andamento com especialistas.
  • Demonstração de protótipos, onde estudantes exibem softwares inovadores.
  • Participação de pesquisadores internacionais, promovendo parcerias e projetos colaborativos.

A 39ª edição do SBBD aconteceu em outubro de 2024, na cidade de Florianópolis-SC. Agora, em outubro de 2025, a conferência chegará a Fortaleza-CE, sob a coordenação de pesquisadores da Universidade Federal do Ceará (UFC) e do Insight Lab, trazendo intensos debates sobre os avanços mais recentes em Ciência de Dados, Big Data e Inteligência Artificial, além de fortalecer conexões entre academia, indústria e governo.

 

Hack4Dev 2025: Ciência de Dados e Pesquisa Espacial

  • Local: Rio de Janeiro – Rio de Janeiro
  • Data: 17 a 20 de março de 2025

De 17 a 20 de março de 2025, o Hack4Dev reunirá mentes brilhantes para uma experiência imersiva de ciência de dados aplicada à pesquisa espacial. O evento, sediado no Centro Brasileiro de Pesquisas Físicas (CBPF), é organizado pelo Laboratório de Inteligência Artificial na Física (LAB-IA) e pelo professor Clécio De Bom, em parceria com o Observatório Nacional (ON) e a Universidade Federal do Rio de Janeiro (UFRJ).

Voltado para estudantes de graduação em fase final e profissionais recém-formados com experiência em programação Python, o Hack4Dev oferece uma oportunidade única de trabalhar em soluções inovadoras utilizando aprendizado de máquina para problemas associados aos CubeSats. Esses pequenos satélites têm um papel crescente em pesquisas tecnológicas e científicas e estão no centro dos desafios propostos no hackathon.

Durante os três dias de atividades intensas, os participantes serão desafiados a desenvolver soluções tecnológicas que envolvam análise de dados e modelos preditivos, promovendo a integração de ciência de dados e tecnologia espacial. O evento também incluirá uma competição dinâmica: as melhores equipes em cada hackathon regional serão premiadas, enquanto o projeto de maior destaque nacional receberá o prestigiado Grande Prêmio Hack4Dev 2025.

As inscrições estão abertas até a primeira semana de fevereiro e os interessados passarão por um processo seletivo que avaliará competências técnicas, motivação e disponibilidade para participação presencial. Para quem busca aliar criatividade, conhecimento técnico e paixão por inovação, o Hack4Dev é uma oportunidade imperdível de explorar o impacto da ciência de dados no futuro da pesquisa espacial.

 

 

Workshop de Informação, Dados e Tecnologia (WIDaT)

  • Local: Marília – São Paulo
  • Data: 27 a 29 de maio de 2025

O Workshop de Informação, Dados e Tecnologia (WIDaT) é um evento de destaque no Brasil que conecta academia, indústria e sociedade para explorar as tendências e desafios na gestão de informações, análise de dados e tecnologias emergentes. Focado na inovação e colaboração, o WIDaT atrai pesquisadores, profissionais e estudantes interessados em áreas como Ciência de Dados, Engenharia de Software, Tecnologias da Informação e Inteligência Artificial.

O evento oferece uma programação rica, com palestras de especialistas renomados, apresentações de trabalhos científicos e sessões interativas, como painéis de discussão e workshops práticos. É uma excelente oportunidade para compartilhar experiências, conhecer avanços tecnológicos e estabelecer conexões valiosas com profissionais do setor.

Em 2025, o WIDaT reforça seu compromisso com a disseminação do conhecimento e o desenvolvimento de soluções inovadoras, sendo imperdível para quem deseja se atualizar nas áreas de dados e tecnologia no Brasil.

 

Simpósio Brasileiro de Sistemas de Informação (SBSI)

  • Local: Recife, Pernambuco
  • Data: 19 a 23 de maio de 2025

Entre os dias 19 e 23 de maio de 2025, Recife-PE será palco da 21ª edição do Simpósio Brasileiro de Sistemas de Informação (SBSI), promovido pela Sociedade Brasileira de Computação (SBC). Com organização da Universidade Federal Rural de Pernambuco (UFRPE) e do Centro de Estudos Avançados do Recife (C.E.S.A.R), o evento abordará o tema “Inovação com Equidade, Diversidade e Inclusão em Sistemas de Informação”.

Nesta edição, o SBSI destaca a relevância de incorporar princípios de Equidade, Diversidade e Inclusão (EDI) no desenvolvimento e na aplicação de sistemas de informação. Mais do que apenas avançar tecnologicamente, o evento busca promover debates e soluções que assegurem que as inovações sejam acessíveis, justas e benéficas para todos, considerando diferentes contextos sociais, culturais e econômicos.

O simpósio oferecerá um espaço para a troca de conhecimentos entre pesquisadores, profissionais, empresas e estudantes, com uma programação diversificada que incluirá apresentações de artigos científicos, painéis de discussão, palestras de especialistas, minicursos e pitches de projetos inovadores. Esses momentos serão oportunidades para explorar como os sistemas de informação podem transformar a sociedade de maneira inclusiva e igualitária.

 

Congresso da Sociedade Brasileira de Computação (CSBC)

  • Local: Maceió – Alagoas
  • Data: 20 a 24 de julho de 2025

De 21 a 25 de julho de 2025, a cidade de Maceió-AL será sede da 45ª edição do Congresso da Sociedade Brasileira de Computação (CSBC), o maior evento de Ciência da Computação da América Latina. Realizado desde 1978, o CSBC é um ponto de encontro para cientistas, engenheiros, pesquisadores, estudantes, empresas e empreendedores, consolidando-se como um dos principais fóruns de discussão sobre avanços tecnológicos e desafios futuros da área.

Com o tema central “Governança Digital para uma Sociedade Sustentável”, a edição de 2025 propõe uma reflexão sobre o papel da tecnologia na construção de um futuro mais sustentável. Entre os tópicos em destaque estão a transparência na gestão de dados e informações, a participação cidadã em decisões estratégicas e a inovação em serviços públicos e privados, com foco em práticas que promovam o equilíbrio entre desenvolvimento tecnológico e responsabilidade ambiental.

Além de palestras, painéis e apresentações de trabalhos científicos, o CSBC 2025 oferecerá uma rica programação cultural, integrando o conhecimento técnico à celebração da cultura e das belezas naturais de Alagoas. O evento será uma oportunidade para conectar-se com os principais nomes da computação no Brasil e explorar novas perspectivas sobre como a tecnologia pode impulsionar mudanças positivas em nossa sociedade.

 

Saiba o que está acontecendo! Continue acompanhando o Insight Lab para mais atualizações sobre a área e eventos imperdíveis!

Categorias
Big Data Ciência de Dados Destaque

Cientista-chefe da Transformação Digital do Governo do Ceará palestra no AWS Public Sector Symposium

Rubem Paulo Saldanha e José Antonio Fernandes de Macêdo integraram o evento “AWS Public Sector Symposium”

 

No dia 09 de maio de 2023 teve lugar no Centro de Eventos Brasil 21, em Brasília, o “AWS Public Sector Symposium”.

Este evento buscou promover a capacitação de agentes, líderes e arquitetos da transformação digital do setor público, a partir de recursos novos e insights com a utilização da tecnologia em nuvem.

“AWS Public Sector Symposium” contou com sessões temáticas em quatro áreas principais: educação, governo e justiça, setor de serviços financeiros e saúde, bem como contribuiu no diálogo de assuntos diretamente relacionados em ajudar organizações do setor público voltadas para serviços governamentais, educacionais, sem fins lucrativos, de saúde e financeiros a explorar o cenário tecnológico.

O Prof. Dr. José Antonio Fernandes de Macêdo (Cientista-chefe da Transformação Digital do Governo do Ceará) foi convidado para participar do referido evento e em sua fala, salientou o papel desafiador em aproximar a discussão acerca dos resultados e impactos alcançados no uso da computação em nuvem na construção da Plataforma Big Data Social, detalhando o Programa Cientista Chefe do Ceará, que contempla a relevante união entre a academia e a gestão pública.

O Programa Cientista Chefe está disponível no site da Fundação Cearense de Apoio ao Desenvolvimento Científico e Tecnológico (Funcap): https://www.funcap.ce.gov.br/programas-de-auxilio/cientista-chefe-geral/

 

Categorias
Big Data Intercâmbio Pesquisa

Alunos de intercâmbio participam de pesquisa no Insight Lab

O Insight recebe durante os próximos meses os estudantes Taya Mohamed Abderrahman e Mohammad Abboud, vindos da Mauritânia e Itália, respectivamente. Ambos estão contribuindo com suas pesquisas no Laboratório Insight como alunos intercambistas.

Taya é aluno de graduação do curso de Engenharia em Inteligência Artificial da Université Mohammed VI Polytechnique – EMINES, no Marrocos. O estudante estará fazendo um estágio no Insight Lab por um período de dois meses com sua pesquisa na área de Processamento de Linguagem Natural intitulada: Improving named entity recognition using Deep Learning with human in the coops (NERD).

Esse intercâmbio é possível graças à parceria entre a Universidade Federal do Ceará (UFC) e diversas universidades no mundo, assim, alunos das áreas de engenharia vêm desenvolver suas pesquisas nos laboratórios de pesquisa da UFC. 

Já o aluno Mohammad está cursando doutorado na Universidade de Versalhes Saint Quentin en Yvelines – Paris Saclay. Mohammad estará em missão de pesquisa por um período de um mês aqui no Insight, e sua vinda é fruto da parceria entre o laboratório Insight e o projeto Master. O pesquisador tem seu trabalho intitulado em: Learning from a mass of multidimensional Times Series in the context of Internet of things.

O projeto Master é coordenado pela Professora Chiara Renso, Doutora em Ciência da Computação, pesquisadora sênior do Instituto ISTI – CNR e integrante do conselho nacional de pesquisa da Itália.

Projeto Master

O objetivo do projeto Master, sediado na Itália, é formar uma rede internacional e intersetorial de organizações trabalhando em um programa de pesquisa conjunta para definir novos métodos para construir, gerenciar e analisar trajetórias semânticas de múltiplos aspectos.

O projeto propõe métodos para analisar e inferir conhecimento a partir de trajetórias de múltiplos aspectos, considerando como questões vitais as dimensões de privacidade e big data como demonstra a imagem abaixo. O laboratório Insight, por meio da UFC, é um dos três parceiros brasileiros desse projeto.

Imagem: Projeto Master

Categorias
Big Data Cientista-chefe

Big Data de Fortaleza e o Programa Cientista Chefe são debatidos na Semana gLocal 2022

A semana de avaliação gLocal, lançada em 2019, é um evento anual dedicado ao compartilhamento de conhecimento e experiência sobre Monitoramento e Avaliação em todo mundo. Organizações de diversos países já sediaram cerca de 1.000 eventos nos cinco continentes e em diversos idiomas. 

Em 2022, a Prefeitura de Fortaleza, por meio do Instituto de Planejamento – IPLANFOR, realizou a Semana gLocal de Avaliação 2022 Fortaleza, nos dias 30 de maio a 3 de junho, no formato on-line com transmissão ao vivo pelo canal do YouTube do Observatório de Fortaleza. 

O evento trouxe mesas redondas, palestras e o workshop com foco nos projetos desenvolvidos pela gestão municipal para aperfeiçoar o acompanhamento da implementação das políticas públicas locais. Na ocasião, técnicos e gestores públicos, profissionais de avaliação e especialistas se uniram a este movimento global para compartilhar conhecimentos e experiências neste campo com a população da cidade.

Big Data de Fortaleza e o Programa Cientista Chefe

 

Imagem: instagram.com/sglocalfortaleza/

 

O professor José Macêdo, coordenador do Insight Lab, esteve entre os palestrantes da Semana gLocal 2022 integrando a mesa “Big Data de Fortaleza e o Programa Cientista Chefe”, organizada pelo Instituto de Planejamento de Fortaleza.

Essa mesa se estruturou a partir da pergunta: como universidades e governos municipais podem se beneficiar mutuamente por meio de projetos conjuntos? O objetivo do debate foi mostrar a construção do Big Data de Fortaleza. O Programa Cientista Chefe e o Instituto de Planejamento de Fortaleza são responsáveis pela infraestrutura do Big Data, que pretende ser uma plataforma analítica capaz de predizer cenários contextualizados, capaz de oferecer evidências para a tomada de decisão de gestores municipais. Em 2017, o programa Cientista Chefe foi criado pela FAP (Fundação de Amparo à Pesquisa) do Estado do Ceará com o objetivo de auxiliar a gestão pública.

Participantes da mesa:

José Antônio Fernandes de MacêdoCientista-Chefe de Dados e Transformação Digital do Estado do Ceará. É professor do Departamento de Computação da Universidade Federal do Ceará, mestre e Doutor pela PUC-Rio, realizou seu pós-doutorado na École Polytechnique Fédéral de Lausanne. 

Tarcisio PequenoPresidente da Fundação Cearense de Apoio ao Desenvolvimento Científico e Tecnológico. Tarcísio é graduado em Engenharia Civil pela Universidade Federal do Ceará (1970), Mestre em Informática pela Pontifícia Universidade Católica do Rio de Janeiro (1977) e Doutor em Informática pela Pontifícia Universidade Católica do Rio de Janeiro (1981).

Rossana Maria de Castro AndradeCientista-chefe de Planejamento da Prefeitura de Fortaleza. Possui doutorado em Computer Science pela University of Ottawa, mestrado em Ciência da Computação pela Universidade Federal da Paraíba e graduação em Ciência da Computação pela Universidade Estadual do Ceará. É professora da Universidade Federal do Ceará, no Departamento de Computação.

Assista aqui Big Data de Fortaleza e o Programa Cientista Chefe:

Para acompanhar mais apresentações e debates que aconteceram durante a Semana gLocal de Avaliação 2022 Fortaleza, acesse: Observatório de Fortaleza – YouTube.

Categorias
Big Data Ciência de Dados Cientista-chefe

Plataforma Big Data Social é Apresentada no I Encontro de Tecnologia para o Desenvolvimento Social

A Secretaria do Planejamento e Gestão do Ceará (Seplag-CE), por meio da sua secretaria executiva do Planejamento e Orçamento, realizou, no dia 30 de maio, o I Encontro de Ciência e Tecnologia para o Desenvolvimento Social. O evento realizado em  parceria com a Fundação Cearense de Apoio ao Desenvolvimento Científico e Tecnológico (Funcap), vinculada à Secretaria da Ciência, Tecnologia e Educação Superior do Estado do Ceará (Secitece), aconteceu no auditório da Seplag.

Apresentação da Plataforma Big Data Social

Na ocasião, José Macêdo, cientista-chefe da Transformação Digital e coordenador do Insight Lab, apresentou a plataforma Big Data Social do Governo do Ceará e sua equipe de trabalho. Estavam presentes também os cientistas-chefes: Flávio Ataliba (Economia), Márcia Machado (Proteção Social) e Jorge Lira (Educação).

 

Imagem: Apresentação Big Data Social

Imagem: Apresentação Big Data Social

No evento foram apresentados os temas aplicados por meio da gestão pública que causaram impactos e estão contribuindo para o progresso social aliado ao advento da tecnologia e a popularização da ciência, e a formação de cidadãos sociais e culturais no contexto tecnológico.

Segundo Flávio Ataliba, secretário executivo do Planejamento e Orçamento da Seplag, o evento surgiu  para apresentar os resultados das pesquisas realizadas nas áreas citadas, além de servir como um momento rico para o compartilhamento de conhecimentos e de novas ideias.

Assista aqui a apresentação do professor Macêdo sobre a plataforma Big Data Social.

Apoiadores

O encontro também teve o apoio da Escola de Gestão Pública do Estado do Ceará (EGPCE) a Universidade Federal do Ceará (UFC), a Fundação Cearense de Apoio ao Desenvolvimento Científico e Tecnológico (Funcap), o Laboratório de Inovação de Dados (ÍRIS), os Programas Cientistas Chefes, o Instituto de Pesquisa e Estratégia Econômica do Ceará (Ipece), a Secretaria da Proteção Social, Justiça Cidadania, Mulheres e Direitos Humanos, a Secretaria da Educação e a Vice-Governadoria do Ceará.

Fonte: Seplag CE

Categorias
Big Data Ciência de Dados Dados

Conheça as joias do infinito na Ciência de Dados

Quais são as joias do infinito da Ciência de Dados? As seis joias do universo Marvel Comics você já deve conhecer: Espaço, Mente, Alma, Realidade, Tempo e Poder.  Quando usadas em conjunto, dão ao seu portador poderes que o torna capaz de controlar todo o universo!

Mas como seriam estes poderosos artefatos usados na Data Science (DS)? Você pode unir diversos poderes para dominar o universo dos dados e assim se tornar um super Cientista de Dados!

Quer saber quais são essas joias? Então vamos lá!

 

? Pedra da Realidade 

A Pedra da Realidade concede ao usuário o poder de manipular a matéria.

Presumivelmente, para manipular a realidade, temos que entendê-la. Essa parece ser uma analogia boa (o suficiente) para a importância do conhecimento do domínio (uma vez que um bom cientista de dados não manipula a realidade, certo?).

Iniciar um projeto de DS sem uma compreensão do domínio do projeto não é apenas uma má ideia, como resultado final provavelmente não retratará a  realidade. Assim como não permitimos que atletas competentes que nunca aprenderam as regras do beisebol joguem  da mesma forma, não devemos esperar ser capazes de realizar Ciência de Dados de maneira competente em um domínio que não entendemos, independentemente de nossas habilidades estatísticas, analíticas, técnicas e relacionadas.

O que exatamente constitui conhecimento de domínio? É relativo. Você está fazendo uma análise descritiva superficial de algum aplicativo de namoro? Ou você está empreendendo algum projeto de análise preditiva aprofundado em finanças para uma organização que se especializou em alguma estratégia obscura de investimento em títulos? O conhecimento necessário do domínio de “namoro” para realizar o primeiro feito é provavelmente insignificante, mas quaisquer insights úteis sobre o segundo certamente exigirão um conhecimento financeiro sólido.

 

? Pedra do Espaço 

 

A Pedra do Espaço dá ao usuário poder sobre o espaço.

Poder sobre o espaço, hein? Que tal poder sobre o espaço de dados? E como alguém obteria poder sobre seu espaço de dados? Conhecimento íntimo, por meio de análise exploratória de dados.

Mas quanta Análise de Dados e exatamente de que tipo de análise estamos falando? Isso vai te surpreender, mas … é relativo. Se estamos interessados ​​em Análise Descritiva – isto é, nenhuma previsão, ao longo das linhas de uma análise de dados direta – quanto mais intimamente estivermos familiarizados com os dados, melhor. O fim é o meio neste caso, e portanto a qualidade de descrever, visualizar e compartilhar os dados, como um analista de dados, está altamente correlacionada com a intimidade da exploração.

Quando se trata de Análise Preditiva e empreendimentos de Machine Learning, existem opiniões divergentes sobre o quanto a análise exploratória de dados é útil. Existem também opiniões divergentes sobre o nível de análise exploratória de datasets que não estão sendo usados ​​para treinamento (ou seja, conjuntos de validação e teste). Deixando isso de lado, para garantir que o poder máximo sobre seu espaço de dados seja alcançado, certifique-se de se proteger contra as armadilhas potenciais de análises de dados exploratórias deficientes ou visualizações de má qualidade, como a falácia da correlação, o paradoxo de Simpson e a falácia ecológica.

Quando realizada de maneira adequada, a análise exploratória de dados fornecerá uma compreensão de seus dados de uma forma que permita o acompanhamento de uma Ciência de Dados bem-sucedida.

 

? Pedra do Tempo

A Pedra do Tempo concede ao seu proprietário o poder de rebobinar ou avançar o tempo.

Se você estudou a complexidade do algoritmo, sabe que a escolha do algoritmo pode impactar severamente o tempo que leva para completar uma determinada tarefa de computação, mesmo com os mesmos dados, e é por esta razão que a seleção do algoritmo e do método é o nosso equivalente a ser capaz de manipular o tempo.

Isso se aplica tanto à seleção completa de algoritmos quanto à configuração de hiperparâmetros, que também têm impacto no tempo de execução. As arquiteturas de rede neural podem ser incrivelmente complexas, mas um par de redes neurais simples equivalentes pode ter tempos de convergência muito diferentes ao usar taxas de aprendizado muito desiguais.

Você sabe sobre a compensação de viés-variância, mas também há uma compensação de espaço-tempo, bem como uma compensação de complexidade-velocidade que pode ser feita. Um modelo de Regressão Logística pode não funcionar tão bem quanto um de Random Forest de milhares de árvores, mas esse impacto no desempenho pode valer a pena para você em troca de velocidade, para não falar do aumento na aplicabilidade que o modelo de Regressão Logística pode fornecer frente ao Random Forest (se essa for sua escolha).

Isso não quer dizer que você deva escolher um algoritmo mais rápido (ou menos complexo, ou menos intensivo em computação ou mais explicável), mas você precisa ter em mente que é uma das compensações que você está fazendo e uma das melhores maneiras que temos de controlar o fluxo do tempo.

 

? Pedra do Poder 

 

A Pedra do Poder concede ao seu portador uma grande quantidade de energia – o tipo de energia que você poderia usar para destruir um planeta inteiro.

Isso soa como muita energia. Onde encontramos esse tipo de energia no mundo da Ciência de Dados? Poder computacional!

Poder computacional (ou “computação”) são os recursos computacionais coletivos que temos para lançar em um problema particular. A computação ilimitada já foi considerada a essência e o fim de tudo da computação, e por um bom motivo. Considere quão pouca computação havia uma, duas ou três décadas atrás, em comparação com hoje. Imagine cientistas pensando sobre problemas que poderiam resolver, se ao menos tivessem mais do que um punhado de MHz de computação à sua disposição. O céu seria o limite!

Claro, não foi exatamente assim que as coisas aconteceram. Temos muito mais computação à nossa disposição agora do que jamais tivemos no passado na forma de supercomputadores, a nuvem, APIs publicamente disponíveis apoiadas por grandes quantidades de computação e até mesmo nossos próprios notebooks e smartphones. Todos os tipos de problemas que nunca poderíamos imaginar que teriam computação suficiente para resolver agora são tratáveis, e isso é um grande desenvolvimento. Precisamos ter em mente, no entanto, que “inteligente” é um grande contrapeso para computar, e muitos avanços na Ciência de Dados e suas tecnologias de apoio foram possibilitados pelo cérebro em vez da força.

Idealmente, um equilíbrio perfeito de cérebro e força muscular poderia ser usado para atacar todos os problemas existentes, com o uso inteligente para configurar uma abordagem algorítmica perfeita e a computação necessária disponível para apoiá-la. Talvez esta seja uma área que a Ciência de Dados um dia venha a provar ser útil.

Até então, tenha certeza de que há computação disponível até mesmo para as abordagens menos que perfeitas para a solução de problemas.

 

Pedra da alma

Não está claro quais são os poderes da Pedra da Alma no universo cinematográfico. Nos quadrinhos, a joia permite que o portador capture e controle as almas dos outros.

“Capture e controle as almas dos outros” soa ameaçador, e mais do que apenas um pouco tortuoso. Mas se dermos uma visão mais positiva do conceito de Pedra da Alma, poderíamos forçar uma equivalência entre ela e o poder de predição. Estamos treinando modelos para controlar a essência mais íntima dos dados não rotulados – sua alma – fazendo previsões informadas sobre o que realmente contém.

Isso não é um exagero. Certo!?

A Pedra da Alma, então, é análoga ao poder de predição, o que quer dizer que está no cerne absoluto da Data Science. O que os cientistas de dados estão tentando realizar? Eles estão tentando responder a perguntas interessantes com os dados disponíveis, a fim de fazer previsões que se alinham o mais próximo possível com a realidade. Essa parte da previsão parece bastante crucial.

E, por ser tão crucial, deve ficar evidente que os resultados devem ser tratados com o máximo cuidado. A alma do nosso trabalho é o valor que ele pode criar seja para negócios, instituições de caridade, governo ou sociedade em geral.

A Ciência de Dados é uma luta pela alma, juntamente com a próxima batalha pela mente.

 

? Pedra da Mente 

A Pedra da Mente permite ao usuário controlar as mentes dos outros.

E no mundo do Data Science, nada melhor para ajudar a controlar as mentes dos outros do que uma apresentação de dados bem elaborada, incluindo uma história atraente e visualizações eficazes.

A modelagem está completa. As previsões foram feitas. Os insights são perspicazes. Agora é hora de informar as partes interessadas do projeto sobre os resultados. Mas os demais profissionais que trabalham em uma equipe, além dos cientistas de dados, não têm os mesmos entendimentos sobre os dados e seu processo, então precisamos ser claros ao apresentar nossas descobertas a eles de uma forma que entendam.

Lembre-se, se seus insights não estiverem claros, então seu trabalho não está completo. Cabe a você convencer os outros do valor do seu trabalho. Uma vez convencidos, eles podem agir e a mudança por meio da ação é a verdadeira recompensa de qualquer projeto de Ciência de Dados.

 

Este artigo foi traduzido de Matthew Mayo no KDnuggets.

Categorias
Big Data Ciência de Dados Machine Learning

Pesquisadores desenvolvem detector de fake news para notícias sobre o Covid-19

Por tratar-se de uma nova ameaça, sabe-se muito pouco sobre o coronavírus (Sars-CoV-2). Esse fator dá grande abertura para disseminação de fake news (como ficou popularmente conhecido o compartilhamento de informações falsas), que podem ir desde supostos métodos de prevenção, tratamentos caseiros, cura do vírus e até mesmo tratamentos controversos recomendados por médicos, mesmo que não haja comprovação ou evidência científica para tais. Tudo isso pode dificultar o trabalho de órgãos de saúde, prejudicar a adoção de medidas de distanciamento social pela população e acarretar aumentos dos números de infectados e de morte pelo vírus.

Para diminuir os impactos dessa desinformação, diversos sites de checagem de fatos têm ferramentas que identificam e classificam (manualmente) tais notícias. Em geral, essas ferramentas poderiam fazer uso de algoritmos de aprendizagem de máquina para classificação de notícias. Diante dessa problemática, é evidente a necessidade de elaborar mecanismos e ferramentas que possam combater eficientemente o caos das fakes news.

Por isso, durante as disciplinas de Aprendizagem de Máquina e Mineração de Dados (Programa de Pós-graduação em Ciência da Computação da Universidade Federal do Ceará (MDCC-UFC)), nós (Andreza Fernandes, Felipe Marcel, Flávio Carneiro e Marianna Ferreira) propusemos um detector de fake news para analisar notícias sobre o COVID-19 divulgadas em redes sociais. Nosso objetivo é ajudar a população quanto ao esclarecimento da veracidade dessas informações.

Agora, detalharemos o processo de desenvolvimento desse detector de fake news.

 

Objetivos do projeto

  • Formar uma base dados de textos com notícias falsas e verdadeiras acerca do COVID-19;
  • Diminuir enviesamento das notícias;
  • Experimentar diferentes representações textuais;
  • Experimentar diferentes abordagens clássicas de aprendizagem de máquina e deep learning;
  • Construir um BOT no Telegram que ajude na detecção de notícias falsas relacionadas ao COVID-19.

 

Entendendo as terminologias usadas

Para o entendimento dos experimentos realizadas, vamos conceituar alguns pontos chaves e técnicas de Processamento de Linguagem Natural.

Tokenização: Esse processo transforma todas as palavras de um texto, dado como entrada, em elementos (conhecidos como tokens) de um vetor.

Remoção de Stopwords: Consiste na remoção de palavras de parada, como “a”, “de”, “o”, “da”, “que”, “e”, “do”, dentre outras, pois na maioria das vezes não são informações relevantes para a construção do modelo.

Bag of words: É uma representação simplificada e esparsa dos dados textuais. Consiste em gerar uma bolsa de palavras do vocabulário existente no dado, que constituirá as features do dataset. Para cada sentença é assinalado um “1” nas colunas que apresentam as palavras que ocorrem na sentença e “0” nas demais.

Term Frequency – Inverse Document Frequency (TF-IDF): Indica a importância de uma palavra em um documento. Enquanto TF está relacionada à frequência do termo, IDF busca balancear a frequência de termos mais comuns/frequentes que outros.

Word embeddings: É uma forma utilizada para representar textos, onde palavras que possuem o mesmo sentido têm uma representação muito parecida. Essa técnica aprende automaticamente, a partir de um corpus de dados, a correlação entre as palavras e o contexto, possibilitando que palavras que frequentemente ocorrem em contextos similares possuam uma representação vetorial próxima. Essa representação possui a vantagem de ter um grande poder de generalização e apresentar baixo custo computacional, uma vez que utiliza representações densas e com poucas dimensões, em oposição a técnicas esparsas, como Bag of Words. Para gerar o mapeamento entre dados textuais e os vetores densos mencionados, existem diversos algoritmos disponíveis, como Word2Vec e FastText, os quais são utilizados neste trabalho.

Out-of-vocabulary (OOV): Consiste nas palavras presentes no dataset que não estão presentes no vocabulário da word embedding, logo, elas não possuem representação vetorial.

Edit Distance: Métrica que quantifica a diferença entre duas palavras, contando o número mínimo de operações necessárias para transformar uma palavra na outra.

 

Metodologia

Agora iremos descrever os passos necessários para a obtenção dos resultados, geração dos modelos e escolha daquele com melhor performance para a efetivação do nosso objetivo.

 

Obtenção dos Dados

Os dados utilizados para a elaboração dos modelos foram adquiridos das notícias falsas brasileiras sobre o COVID-19, dispostos no Chequeado, e de um web crawler dos links das notícias, utilizadas para comprovar que a notícia é falsa no Chequeado, para formar uma base de notícias verdadeiras. Além disso também foi realizado um web crawler para obtenção de notícias do Fato Ou Fake do G1.

Originalmente, os dados obtidos do Chequeado possuíam as classificações “Falso”, “Enganoso”, “Parcialmente falso”, “Dúbio”, “Distorcido”, “Exagerado” e “Verdadeiro mas”, que foram mapeadas todas para “Falso”. Com isso, transformamos nosso problema em classificação binária.

No final, obtivemos um dataset com 1.753 notícias, sendo 808 fakes, simbolizada como classe 0, e 945 verdadeiras, classe 1, com um vocabulário de tamanho 3.698. Com isso, dividimos o nosso dado em conjunto de treino e teste, com tamanhos de 80% e 20%, respectivamente.

 

Pré-processamento

Diminuição do viés. Ao trabalhar e visualizar os dados, notamos que algumas notícias verdadeiras vinham com palavras e sentenças que enviesavam e deixavam bastante claro para os algoritmos o que é fake e o que é verdadeiro, como: “É falso que”, “#Checamos”, “Verificamos que” e etc. Com isso, removemos essas sentenças e palavras, a fim de diminuir o enviesamento das notícias.

Limpeza textual. Após a etapa anterior, realizamos a limpeza do texto, consistindo em remoção de caracteres estranhos e sinais de pontuação e uso do texto em caixa baixa.

Tokenização. A partir do texto limpo, inicializamos o processo de tokenização das sentenças.

Remoção das Stopwords. A partir das sentenças tokenizadas, removemos as stopwords.

 

Representação textual

Análise exploratória

A partir do pré-processamento dos dados brutos, inicializamos o processo de análise exploratória dos dados. Verificamos o tamanho do vocabulário do nosso dataset, que totaliza 3.698 palavras. 

 

Análise do Out-of-vocabulary. Com isso, verificamos o tamanho do nosso out-of-vocabulary em relação às word embeddings pré-treinadas utilizadas, totalizando 32 palavras. Um fato curioso é que palavras chaves do nosso contexto encontram-se no out-of-vocabulary e acabam sendo mapeadas para palavras que não tem muita conexão com o seu significado. Abaixo é possível ver algumas dessas palavras mais à esquerda, e a palavra a qual foram mapeadas mais à direita.

Mapeamento de palavras

 

Análise da frequência das fake news por rede social. O dado bruto original advindo do Chequeado possui uma coluna que diz sobre a mídia social em que a fake news foi divulgada. Após uma análise visual superficial, apenas plotando a contagem dos valores dessa coluna (que acarreta até na repetição de redes sociais), notamos que os maiores veículos de propagação de fake news são o Facebook e Whatsapp.

 

 

Frequência de fake news por rede social

 

Análise da quantidade de fake news ao longo dos meses. O dado bruto original advindo do Chequeado também possui uma coluna que informava a data de publicação da fake news. Após realizar uma análise visual da distribuição da quantidade de fake news ao longo dos meses, notamos que o maior número de fake news ocorreu em abril, mês em que a doença começou a se espalhar com maior velocidade no território brasileiro. De acordo com o G1, em 28 de abril, o Brasil possuía 73.235 casos do novo coronavírus (Sars-CoV-2), com 5.083 mortes. Além disso, foi nesse mês que começaram a surgir os boatos de combate do Coronavírus via Cloroquina, além de remédios caseiros.

Volume de fake news relacionadas ao COVID-19 ao longo dos meses

 

Análise da Word Cloud. Com as sentenças tokenizadas, também realizamos uma visualização usando a técnica de Word Cloud, que apresenta as palavras do vocabulário em um tamanho proporcional ao seu número de ocorrência no todo. Com essa técnica, realizamos duas visualizações, uma para as notícias verdadeiras e outra para as fake news.

Nuvem de palavras nas notícias falsas

 

Nuvem de palavras nas notícias verdadeiras

 

Divisão treino e teste

A divisão dos conjuntos de dados entre treino e teste foi feita com uma distribuição de 80% e 20% dos dados, respectivamente. Os dados de treino foram ainda divididos em um novo conjunto de treino e um de validação, com uma distribuição de 80% e 20% respectivamente.

 

Aplicação dos modelos

Para gerar os modelos, escolhemos algoritmos e técnicas clássicas  de aprendizagem de máquina, tais como técnicas atuais e bastante utilizadas em competições, sendo eles: 

  • Regressão Logística (*): exemplo de classificador linear;
  • K-NN (*): exemplo de modelo não-paramétrico;
  • Análise Discriminante Gaussiano (*): exemplo de modelo que não possui hiperparâmetros;
  • Árvore de Decisão: exemplo de modelo que utiliza abordagem da heurística gulosa;
  • Random Forest: exemplo de ensemble de bagging de Árvores de Decisão;
  • SVM: exemplo de modelo que encontra um ótimo global;
  • XGBoost: também um ensemble amplamente utilizado em competições do Kaggle;
  • LSTM-Dense: exemplo de arquitetura que utiliza deep learning.

Os algoritmos foram utilizados por meio de implementações próprias (aqueles demarcados com *) e uso da biblioteca scikit-learn e keras.  Para todos os algoritmos, com exceção daqueles que não possuem hiperparâmetros e LSTM-Dense, realizamos Grid Search em busca dos melhores hiperparâmetros e realizamos técnicas de Cross Validation para aqueles utilizados por meio do Scikit-Learn, com k fold igual a 5.

 

Obtenção das métricas

As métricas utilizadas para medir a performance dos modelos foram acurácia, Precision, Recall, F1-score e ROC.

 

                Tabela 1. Resultados das melhores representações por algoritmo

MODELOS PRECISION RECALL F1-SCORE ACCURACY ROC
XGBoost BOW e TF-IDF* 1 1 1 1 1
SVM BOW E TF-IDF* 1 1 1 1 1
Regressão Logística BOW 0.7560 0.7549 0.7539 0.7549 0.7521
LSTM FASTTEXT 0.7496 0.7492 0.7493 0.7492 0.7492
Random Forest TF-IDF 0.7407 0.7407 0.7402 0.7407 0.7388
Árvore de Decisão TF-IDF 0.7120 0.7122 0.7121 0.7122 0.7111
Análise Discriminante Gaussiano Word2Vec 0.7132 0.7122 0.7106 0.7122 0.7089
k-NN FastText 0.6831 0.6809 0.6775 0.6638 0.6550

 

 

                Tabela 2. Resultados das piores representações por algoritmo

MODELOS PRECISION RECALL F1-SCORE ACCURACY ROC
XGBoost Word2Vec  0.7238 0.7236 0.7227 0.7236 0.7211
SVM Word2Vec 0.7211 0.7179 0.7151 0.7179 0.7135
Árvore de Decisão Word2Vec 0.6391 0.6353 0.6351 0.6353 0.6372
Random Forest Word2Vec 0.6231 0.6210 0.6212 0.6210 0.62198
Regressão Logística FastText 0.6158 0.5982 0.5688 0.59829 0.5858
Análise Discriminante Gaussiano TF-IDF 0.5802 0.5811 0.5801 0.5811 0.5786
k-NN BOW 0.5140 0.5099 0.5087 0.5042 0.5127
LSTM WORD2VEC (*) 0.4660 0.4615 0.4367 0.4615 0.4717

 

Resultados

Com os resultados apresentados percebemos que os modelos SVM e XGBoost com as representações TF-IDF e BOW atingiram as métricas igual a 100%. Isso pode ser um grande indicativo de sobreajuste do modelo aos dados. Abaixo podemos visualizar a matriz de confusão e a curva ROC dos mesmos.

Logo após vem a Regressão Logística com métricas em torno de ~75.49%! Abaixo podemos visualizar sua matriz de confusão e a curva ROC.

 

Exemplos de classificações da Regressão Logística

  • True Positive (corretamente classificada)
    • Texto que diz que vitamina C e limão combatem o coronavírus
  • True Negative (corretamente classificada)
    • Notícia divulgada em 2015 pela TV italiana RAI comprova que o novo coronavírus foi criado em laboratório pelo governo chinês.
  • False Positive (erroneamente classificada)
    • Vitamina C com zinco previne e trata a infecção por coronavírus
  • False Negative (erroneamente classificada)
    • Que neurocientista britânico publicou estudo mostrando que 80% da população é imune ao novo coronavírus

Intrigados com os resultados, resolvemos visualizar as diferentes representações de dados em 2 componentes principais (visto a alta dimensionalidade do dado, o que prejudica a análise do que está acontecendo de fato) por meio das técnicas de PCA e T-SNE, separando por cor de acordo com sua classificação. 

É interessante notar que as representações de word embeddings utilizadas possui uma representação bastante confusa e misturada. Já as representações TF-IDF e Bag of Words são facilmente separáveis.

 

 

                            FastText PCA (Semelhante ao Word2Vec)

 

                                       FastText T-SNE

 

 

                                         Word2Vec T-SNE

 

 

                                   BOW PCA (Semelhante ao TF-IDF)

 

 

                                              BOW T-SNE

 

 

                                             TF-IDF T-SNE

 

Conclusão

A base de dados utilizada para obtenção dos modelos foi obtida por meio do site Chequeado, e, posteriormente, houve o enriquecimento dessa base por meio do  web crawler, totalizando 1.383 registros, sendo 701 fake news e 682 notícias verdadeiras. 

Para representação textual foram utilizadas as técnicas Bag of Words, TF-IDF e Word embeddings Word2Vec e FastText de 300 dimensões com pesos pré-treinados obtidas por meio da técnica CBOW com dimensões, disponibilizadas pelo Núcleo Interinstitucional de Linguística Computacional (NILC).  Para gerar os modelos foram utilizados os algoritmos Regressão Logística, kNN, Análise Discriminante Gaussiano, Árvore de Decisão, Random Forest, Gradient Boosting, SVM e LSTM-Dense. Para avaliação dos modelos foi utilizado as métricas Acurácia, Precision, Recall, F1-score, AUC-ROC e matriz de confusão.

Considerando os experimentos e os resultados, conclui-se que o objetivo principal deste trabalho, gerar modelos capazes de classificar notícias extraídas de redes sociais relacionadas ao COVID-19 como falsas e verdadeiras, foi alcançado com êxito. Como resultados, vimos que os modelos SVM e XGBoost com TF-IDF e BOW atingiram 100% nas métricas, com grandes chances de terem se sobreajustado aos dados. Com isso, consideramos como melhor modelo a Regressão Logística com a representação BOW, atingindo as métricas com valores próximos a 75.49%. 

O pior classificador foi o kNN com o BOW e LSTM-Dense com Word2Vec, porém é importante ressaltar que este último não contou com Grid Search e foi treinado com poucas épocas. No geral, as melhores representações foram a TF-IDF e BOW e a pior o Word2Vec.

Para este projeto houveram algumas dificuldades, sendo a principal delas a formação da base de dados, visto que o contexto pandêmico do COVID-19 é algo novo e devido à limitação da API do Twitter em relação ao tempo para extrair os tweets, que era originalmente a ideia da base de dados para esse projeto. Além disso, também houve a dificuldade de remoção do viés dos dados.

 

Como trabalhos futuros, visamos:

  • Ampliar a base de dados;
  • Investigar o que levou ao desempenho do SVM, XGBOOST com as representações TF-IDF e BOW.
  • Analisar performance dos modelos utilizando outras word embeddings pré-treinadas, como o BERT, Glove e Wang2vec.
  • Investigar o uso do modelo pré-treinado do BERT e com fine-tuned.
  • Aplicar PCA Probabilístico
  • Utilizar arquiteturas de deep learning mais difundidas na comunidade científica.

 

                                    

Categorias
Big Data Ciência de Dados Inteligência Artificial

A Ciência de Dados no mercado: 7 casos de sucesso

A ciência de dados tem revolucionado praticamente todas as áreas. Na educação, utilizando modelos para uma melhor avaliação de estudantes, na medicina, identificando e prevendo doenças, no futebol, obtendo o máximo valor das escalações de um time.

Neste artigo, apresentaremos 7 exemplos onde a ciência de dados é utilizada como uma poderosa ferramenta, com modelos e algoritmos que ajudam a analisar, prever e, consequentemente, obter melhores resultados em cada uma dessas áreas.

1- Segurança Pública

Em uma ação criminosa existem diversos elementos envolvidos. Informações colhidas anteriormente sobre os suspeitos (a exemplo, a ficha criminal) e sobre a região na qual um crime foi cometido (como entorno e vias de acesso) são fatores importantes na elucidação de delitos.

No entanto, muitas vezes esses dados coletados em diferentes regiões e por diferentes órgãos não estão integradas em uma mesma base de dados, o que prejudica o trabalho dos agentes policiais.

O Ceará tem sido um exemplo do uso inteligente da ciência de dados na segurança pública. Em 2019, o estado ganhou interesse nacional pela grande redução de seus índices criminais. Entre as diversas ações tomadas para atingir esse resultado, um dos maiores destaques é o uso de soluções tecnológicas baseadas em ciência de dados.

Em parceria com a Secretaria da Segurança Pública e Defesa Social (SSPDS), o Insight Lab desenvolveu ferramentas que têm ajudado a entender e combater práticas criminosas.

Conheça algumas dessas ferramentas:

Sistema Policial Indicativo de Abordagem (SPIA)

O Spia tem sido usado no enfraquecimento da mobilidade de criminosos, pois ajuda na identificação de veículos roubados. É um sistema de inteligência artificial que integra as bases de dados de órgãos federais, estaduais e municipais aos dados captados por mais 3.300 câmeras espalhadas pelo Ceará.

Big Data “Odin”

Como apresentado no portal do Governo do Estado do Ceará, o sistema de big data Odin “armazena e cruza dados obtidos por mais de 50 sistemas dos órgãos de segurança e de entidades parceiras. Todas as informações podem ser vistas em tempo real dentro de um painel que simplifica os processos de investigação e de tomadas de decisão, o Cerebrum.”

Portal do Comando Avançado (PCA)

Exclusivo para profissionais da segurança pública do Ceará, é um aplicativo para celular que reúne informações civil e criminal da população cearense, dados de veículos e motoristas, biometria e o reconhecimento facial.

 

2 – Evasão fiscal e detecção de fraude

Um grande desafio dentro de empresas e organizações é a detecção de fraudes e a evasão fiscal. Uma pequena porcentagem dessas atividades pode representar perdas bilionárias para as instituições.

Entretanto, os avanços na análise de fraudes, com o uso de ciência de dados e o Big Data, são uma perfeita ferramenta para prevenir tais atividades.  Além da redução de informações, com essas ferramentas pode-se diferenciar entre contribuinte legítimo e fraudador, utilizando classificação de dados, clustering e reconhecimento de padrão, por exemplo. Diferentes fontes de dados são usadas para a análise, sejam dados estruturados ou não estruturados.

Diversos estudiosos estão empenhados em desvanecer esse problema. Veja um exemplo disso: a partir de dados reais da Secretaria da Fazenda do Estado do Ceará (Sefaz-CE), sete pesquisadores (entre eles o coordenador do Insight Lab, José Macêdo) aplicaram um novo método,  ALICIA, para detectar potenciais fraudadores fiscais. Esse método de seleção de recursos é baseado em regras de associação e lógica proposicional.

Os autores explicam que ALICIA é estruturado em três fases:

  1. Ele gera um conjunto de regras de associação relevantes a partir de um conjunto de indicadores de fraude (recursos).
  2. A partir de tais regras de associação, ALICIA constrói um gráfico, cuja estrutura é então usada para determinar as características mais relevantes.
  3. Para conseguir isso, ALICIA aplica uma nova medida de centralidade chamada de Importância Topológica do Recurso.

Os teste feitos com ALICIA em quatro diferentes conjuntos de dados do mundo real mostram sua eficiência superior a outros oito métodos de seleção de recursos. Os resultados mostram que Alicia atinge pontuações de medida F de até 76,88% e supera de forma consistente seus concorrentes.

 

3 –  Saúde 

Uma das principais aplicações da ciência de dados é na área da saúde. Esse setor utiliza intensamente data science para descoberta de novas drogas, na prevenção, diagnóstico e tratamento de doenças e no monitoramento da saúde de pacientes.

E durante a pandemia de Covid-19, a ciência de dados foi um dos primeiros auxílios buscados para que se pudesse entender o comportando do vírus na população mundial, criar modelos preditivos sobre seus impactos e divulgar ao público, especialmente através da visualização de dados, estatísticas relacionadas à doença.

Como exemplo de transparência dos dados durante a pandemia, destacamos a plataforma cearense IntegraSUS Analytics.

Como descrito pela Secretaria da Saúde do Ceará, o IntegraSUS Analytics é uma ferramenta com a qual “pesquisadores, profissionais e estudantes de ciência de dados ou de tecnologia da informação poderão ter acesso ao cenário atual da saúde no Estado. Tudo por meio dos códigos e modelos utilizados na construção do IntegraSUS. A plataforma também oferece datasets sobre diferentes áreas da saúde para aprendizado e treinamento.”

Além do IntegraSUS Analytics, o Governo do Estado esteve em parceria com o Insight Lab para desenvolver outras ações de enfrentamento ao Covid-19. Nossos pesquisadores produziram Mapas de Kernel para observar como está acontecendo o espalhamento da doença no Ceará. Junto a isso, a professora Ticiana Linhares comandou o desenvolvimento de um algoritmo de IA para entender a evolução dos sintomas do Covid-19.

Como isso acontece? Através dos textos trocados via chat (Plantão Coronavírus) entre os cidadãos e a Secretaria de Saúde, o algoritmo extrai dessas conversas os sintomas mais frequentes e avalia sua evolução.

 

4 – Games

Uma das indústrias em maior expansão é a de games. Contabiliza-se atualmente mais de 2 bilhões de jogadores no mundo todo, com estimativas para que esse número passe de 3 bilhões até 2023, segundo o site Statista.

Com esse super número de jogadores e a criação diária de novos jogos, uma enorme quantidade de dados são coletados, tais como o tempo de jogo do usuário, pontos de início e parada e pontuação. Essa coletânea de dados representa uma rica fonte para que especialistas estudem, aprendam e possam otimizar e melhorar os jogos.

Com a ciência de dados aplicada no mercado de jogos, é possível realizar o desenvolvimento, a monetização e o design de games, e ainda melhorar efeitos visuais, por exemplo. Com modelos que permitem a identificação de objetos, jogos tornam-se mais realistas tornando possível diferenciar jogadores pertencentes a equipes diferentes e dar comandos ao personagem específico dentro de um grupo.

A King, empresa criadora do famoso Candy Crush, tem, segundo seu diretor de produtos de serviços, Jonathan Palmer, uma cultura baseada em dados. Na King, depois que um jogo é lançado, ele continua sendo monitorado e os ajustes necessários são feitos. Eles analisam, por exemplo, se um jogo é muito difícil, então eles podem perder jogadores, e se muito fácil, os usuários ficam entediados e abandonam o jogo.

Palmer cita o nível 65 do Candy Crush Saga: “É um nível incrivelmente difícil, tinha seu próprio culto em torno dele. Percebemos que isso estava causando a agitação de muitas pessoas. Usando dados, pudemos dizer: ‘precisamos diminuir um pouco a dificuldade desse nível’.”

 

5 – Vida Social

O surgimento das redes sociais alterou completamente a forma como nos relacionamos, sejam relacionamentos amorosos, amizades ou relações de trabalho. Nos conectamos diariamente com inúmeras pessoas que jamais vimos. E todas as relações e ações nessas redes deixam extensos rastros de dados que influenciam, entre outras coisas, em quem você conhecerá a seguir.

Não é impressionante como o Facebook sempre acerta nas recomendações de novas amizades? Em artigo do Washington Post é dito que ele se baseia em “really good math”, mais especificamente, o Facebook utiliza um tipo de ciência de dados conhecido como network science, que basicamente busca prever o crescimento da rede social de um usuário baseado no crescimento das redes de usuários semelhantes.

Um outro exemplo é o Tinder. Ele utiliza um algoritmo que visa aumentar a probabilidade de correspondência. Esse algoritmo  prioriza correspondências entre usuários ativos, usuários em uma mesma região e usuários que parecem os “tipos” uns dos outros com base em seu histórico de deslize.

 

6 – Esportes

A indústria do esporte é uma das mais rentáveis do mundo, gerando lucros bilionários todos os anos e, é claro, cheia de dados e estatísticas. Cada esporte está repleto de variáveis a serem estudadas, que vão desde o clima, a fisiologia de cada jogador, as decisões dos árbitros, até as escolhas feitas pelos jogadores durante uma partida. Assim, a ciência de dados vem para “decifrar” o que fazer com esses dados, revelando insights preditivos para a melhor tomada de decisão dentro de cada modalidade de esporte.

Um caso interessante para analisarmos é o da liga de basquete americana. A NBA usa o sistema de análise de arremesso da RSPCT, no qual uma câmera rastreia quando e onde a bola bate em cada tentativa de cesta. Os dados são canalizados para um dispositivo que exibe detalhes da tomada em tempo real e gera insights preditivos.

Leo Moravtchik, CEO da RSPCT, disse à SGV News que “com base em nossos dados … Podemos dizer [a um jogador]: ‘Se você está prestes a dar o último arremesso para ganhar o jogo, não tente do topo da chave, porque sua melhor localização é, na verdade, o canto direito ”

7 –  Comércio eletrônico (e-commerce) 

O comércio eletrônico (ou e-Commerce) é um tipo de negócio em que empresas e indivíduos compram e vendem coisas pela internet.  Nesse tipo de comércio, a interação com os clientes passa por vários pontos, desde o clique em um anúncio e em produtos de interesse, até a compra e avaliação do produto.

Os dados obtidos nas plataformas de e-commerce ajudam os vendedores a construir uma imagem dos consumidores, seus hábitos de compra, quais as estratégias para “transformá-los” em clientes e ainda o tempo que isso leva.

Nesse sentido, a aplicação da ciência de dados permite a previsão da rotatividade de clientes, a segmentação destes, o impulsionamento das vendas com recomendações inteligentes de produtos, a extração de informações úteis das avaliações dos compradores, a previsão de demanda, a otimização de preços e tantas outras possibilidades.

No caso do Airbnb, a ciência de dados ajudou a renovar completamente sua função de pesquisa, destacando áreas mais requisitadas. O algoritmo do Airbnb hoje, nos rankings de busca, dá prioridade a aluguéis que estiverem em uma área com alta densidade de reservas. Antes, entretanto, os melhores aluguéis estavam localizados a uma certa distância dos centros da cidade. Isso implicava que, apesar de encontrar aluguéis legais, os locais não eram tão bons.

 

 

Referências

How data science and big data analytics leads to better tax fraud prevention

Top 8 Data Science Use Cases in Gaming

Number of active video gamers worldwide from 2015 to 2023 (in billions)

How King is crushing games data

How Facebook knows who all your friends are, even better than you do

Data Science in the Sports Industry

Applying Data Science tools and techniques to eCommerce

 

Categorias
Big Data Ceará Dados

SSPDS inicia banco de dados sobre pichações para mapear grupos criminosos no Ceará

A Secretaria da Segurança Pública e Defesa Social do Estado do Ceará (SSPDS/CE) iniciou o mapeamento da atuação de grupos criminosos do Ceará com a coleta de dados sobre pichações em edificações e muros utilizando inteligência artificial. Baseado na ciência de dados, o aplicativo Portal de Comando Avançado (PCA) agora oferece a função “pichação”, que reunirá dados para estabelecer padrões e comportamentos de integrantes desses grupos no Estado. Essa será mais uma ferramenta para subsidiar o trabalho das agências de inteligência policiais do Estado, reunindo um banco de dados com informações que serão integradas ao Big Data da Segurança Pública.

A primeira coleta da iniciativa aconteceu, nessa segunda-feira (13), durante implantação da 30ª base do Programa de Proteção Territorial e Gestão de Risco (Proteger), a unidade fica no município de Caucaia, na Região Metropolitana de Fortaleza.

Forma de expressão mais utilizada por integrantes de organizações criminosas, as pichações funcionam como instrumento para demarcar territórios, fazer ameaças a rivais e tentar demonstrar poder sobre uma área delimitada. A partir dessa premissa e baseado na análise de comportamentos coletivo e individualizado dos investigados, a SSPDS inicia um levantamento que irá produzir material de inteligência policial para apoiar a investigação criminal e o planejamento de patrulhamento ostensivo realizado pelas agências de segurança pública do Estado. Na prática, os próprios criminosos irão fornecer material para a Polícia alimentar o Big Data; aquilo que pode parecer demonstração de força será empregada para enfraquecer suas ações e fortalecer a segurança pública do Ceará.

 

 

Todas as informações serão alimentadas utilizando o Programa de Comando Avançado (PCA), aplicativo para celulares de uso exclusivo de profissionais da segurança pública do Ceará. Lembrando que pichar é crime conforme a Lei de Crimes Ambientais, com pena detenção que chega até um ano, e multa.

Para o secretário da SSPDS, André Costa, essa é mais uma inovação desenvolvida pela Secretaria na área de ciência policial e tecnologia aplicadas à segurança pública, que vai servir de exemplo para todo o País e América Latina. “Essa nova função que a gente começa a usar hoje (segunda-feira, dia 13) vai permitir que todo policial, a partir de agora, torne-se um agente de inteligência. Ele vai poder, através do smartphone, inserir uma fotografia, que será georreferenciada, ou seja, o próprio celular já vai dar a localização de onde ela (a pichação) está e também marcar o dia e hora dessa fotografia. Ele ainda vai incluir qual o grupo criminoso a que se refere à pichação. Quando esses criminosos picharem o local e os policiais fotografarem e enviarem esses dados, eles entram na base do nosso Big Data da Segurança Pública”, explica.

Os dados compilados na função “Pichação” no aplicativo PCA servirão para construir parâmetros de atuação dos grupos criminosos no Estado e para fomentar estratégias policiais de combate aos crimes nessas áreas. “Os policiais das áreas de investigação e inteligência vão poder ver os dados em um mapa e, assim, a gente vai ter um mapeamento atualizado com dados de determinado grupo criminoso em qual área, bairro ou comunidade ele se encontra. Isso é fundamental para as ações de inteligência tanto para as investigações como também para que o próprio patrulhamento possa organizar seus efetivos e entender quais áreas devem ser priorizadas”, destaca André Costa.

Junto à estratégia de inteligência para coletar dados para uso da segurança pública, os locais onde os policiais encontrarem pichações com marcas de grupos criminosos serão pintados. “Iremos cobrir essas pichações e tirar essas identidades visuais. Isso é muito negativo aqui, especialmente para a juventude, que vê esse exemplo envolvendo facções”, frisou André Costa.

Na palma da mão

O funcionamento da iniciativa é semelhante ao que já acontece com outras ferramentas tecnológicas criadas e desenvolvidas pela SSPDS, em laboratórios cearenses, por meio de pesquisadores financiados pelo Estado do Ceará e com a participação direta de profissionais do Sistema de Segurança do Ceará. O dispositivo utilizado para a função “Pichação” é o Programa de Comando Avançado (PCA), aplicativo para celular que integra bases civil e criminal da população do Estado, dados de veículos e motoristas, biometria e o reconhecimento facial. A nova função já está disponível para atualização nas lojas virtuais para usuários que utilizam os sistemas operacionais iOS e Android. O uso é exclusivo para servidores da segurança pública.

 

 

Como funciona?

Com um smartphone nas mãos e com o aplicativo PCA aberto, o policial vai iniciar o cadastro da pichação inserindo informações relevantes sobre as características encontradas no local. Primeiro, ele vai marcar a qual grupo criminoso pertence aquela pichação, em seguida, incluir uma descrição apontando onde a pichação foi encontrada, como por exemplo, “na parede de uma casa”, “na fachada de um estabelecimento comercial”. O próximo passo é acionar a câmera do celular para fazer o registro fotográfico das inscrições deixadas pelos criminosos. Por fim, o policial vai posicionar no mapa a localização exata da pichação utilizando o GPS do aparelho celular e concluir o cadastro na ferramenta. Em tempo real, as informações são transmitidas para o Big Data para acesso das agências de inteligência policial do Estado.

Tecnologia compartilhada

A função “Pichação” foi desenvolvida numa parceria entre a Secretaria da Segurança Pública e Defesa Social do Estado do Ceará (SSPDS/CE) e o Laboratório de Processamento de Imagem, Sinais e Computação Aplicada (Lapisco), vinculado ao Instituto Federal de Educação, Ciência e Tecnologia do Ceará (IFCE). A colaboração entre as instituições também propiciou a criação e uso do reconhecimento facial, outra ferramenta disponível ao policial que acessa o aplicativo PCA. Juntos, SSPDS e IFCE constroem soluções para aprimorar o uso da tecnologia aplicada à segurança pública a partir da análise de sinais (áudio, voz, imagem, vídeo).

Big Data da Segurança Pública

A criação do Big Data da Segurança Pública, batizado de “Odin”, é fruto da parceria entre a SSPDS e pesquisadores da Universidade Federal do Ceará (UFC). A ferramenta integra mais de 100 sistemas dos órgãos de Segurança Pública do Estado e de instituições parceiras em uma única plataforma. Ela permite a tomada de decisão baseada em dados, feita de forma automática e em tempo real, dando maior celeridade aos processos e economia de tempo. Além disso, o “Odin” facilita o processo de investigação e inteligência policial com o detalhamento de territórios e informações de caráter investigativo, contribuindo para a formulação de estratégias de combate à criminalidade.

 

Fonte: Governo do Estado do Ceará

 

 

Categorias
Big Data Dados Mineração de Processos

O Papel da Mineração de Processos na Ciência de Dados

O interesse pela ciência de dados está crescendo rapidamente. Muitos a consideram como a profissão do futuro. O hype relacionado à Big Data e à análise preditiva ilustra isso. (“Big” e “Small”) Data são essenciais para pessoas e organizações, aumentando sua importância. No entanto, não é suficiente se concentrar no armazenamento e análise de dados. Um cientista de dados também precisa relacionar dados a processos operacionais e ser capaz de fazer as perguntas certas. 

A relevância da Mineração de Processos

Na última década, Process Mining (Mineração de Processos) surgiu como um novo campo de pesquisa que se concentra na análise de processos usando dados de eventos. As técnicas clássicas de mineração de dados, como classificação, clustering, regressão, aprendizado de regras de associação, não se concentram nos modelos de processos de negócios e geralmente são usadas apenas para analisar uma etapa específica do processo geral. 

Mineração de Processos se concentra nos processos fim-a-fim e isso é possível devido à crescente disponibilidade de dados de eventos e novas técnicas de descoberta de processos e verificação de conformidade. A relevância prática da mineração de processos e os interessantes desafios científicos tornaram essa nova área um dos hot topics da ciência de dados. 

O que é a mineração de processos? 

Primeiro precisamos definir formalmente o que essa nova área aborda. O ponto de partida para a mineração de processos é um log de eventos. Cada evento nesse log refere-se a uma atividade (isto é, uma etapa bem definida em algum processo) e está relacionado a um caso específico (isto é, uma instância do processo). 

Os eventos pertencentes a um caso são ordenados e podem ser vistos como uma “execução” do processo. Os logs de eventos podem armazenar informações adicionais sobre eventos. De fato, sempre que possível, as técnicas de mineração de processo usam informações extras, como o recurso (ou seja, pessoa ou dispositivo) que executa ou inicia a atividade, o registro de data e hora do evento ou elementos de dados registrados com o evento (por exemplo, o tamanho de um pedido). 

Assim, a mineração de processos visa descobrir, monitorar e melhorar processos reais extraindo conhecimento dos logs de eventos disponíveis nos sistemas de informações atuais. Ao usar process mining é possível descobrir processos reais, checar sua conformidade, quantificar os desvios, descobrir o que causa a variação dos processos, encontrar gargalos, predizer saídas dos processos, entre outros benefícios. O objetivo dessa área é transformar dados de eventos em insights e ações. Process mining é parte integrante da ciência de dados, estimulada pela disponibilidade de dados e pelo desejo de melhorar os processos. 

As três classificações de Mineração de Processos

A descoberta de processos constrói um modelo a partir de um log de eventos, sem nenhuma informação a priori. Um exemplo disso é o algoritmo alpha

Já as técnicas de conformidade visam analisar a compatibilidade de um log de eventos a um modelo de processo já existente. A verificação de conformidade pode ser usada para verificar se a realidade do modelo condiz com o que foi registrado no log e vice-versa.

Por fim, o aprimoramento melhora automaticamente um modelo de processo de acordo com um log de eventos. Enquanto a conformidade mede o alinhamento entre o modelo e a realidade, esse terceiro tipo de mineração de processo visa alterar ou estender o modelo a priori. 

Em que contexto é aplicado? 

Uma aplicação para mineração de processos é a pesquisa de serviços de saúde. Esse é um campo científico que analisa os workflows e os processos de monitoramento à saúde no que diz respeito à eficiência e eficácia. Um dos seus principais objetivos é o desenvolvimento e implementação de conceitos de assistência médica baseada em evidências. Portanto, esse área busca melhorar a qualidade de atendimentos médicos, considerando que os recursos disponíveis são escassos. Um objetivo importante é a validação de ensaios clínicos na literatura.

No contexto educacional, foi criada uma nova vertente, chamada EPM – Educational Process Mining (Mineração de processos educacionais), que tem como objetivo construir modelos de processos educacionais completos e compactos que sejam capazes de reproduzir todo o comportamento observado. Os resultados da EPM podem ser usados para obter uma melhor compreensão dos processos educacionais subjacentes, gerar recomendações e conselhos para os alunos, fornecer feedback aos alunos, professores e pesquisadores, para detectar precocemente dificuldades de aprendizado. 

Já no contexto de Engenharia de Software, foi definida uma subárea chamada Software Process Mining (Mineração de Processos de Software). Nesta área, as pessoas se concentram na análise de rastreamentos de tempo de execução para melhorar a arquitetura e o desempenho dos sistemas de software, e na análise do comportamento do usuário para melhorar o design e a usabilidade dos sistemas de software. 

Por fim

Em resumo, as técnicas de mineração de processos podem ser aplicadas em qualquer contexto, desde que seja possível transformar os dados de entrada em logs de eventos. Ela se tornou uma ferramenta vital para as organizações modernas que precisam gerenciar seus processos operacionais complexos, e por conta disso, ela se tornou um dos principais pilares da ciência de dados.

 

Referências Bibliográficas 

BOGARÍN, Alejandro et al. Clustering for improving educational process mining. In: Proceedings of the fourth international conference on learning analytics and knowledge. 2014. p. 11-15. 

RUBIN, Vladimir; LOMAZOVA, Irina; AALST, Wil MP van der. Agile development with software process mining. In: Proceedings of the 2014 international conference on software and system process. 2014. p. 70-74. 

VAN DER AALST, Wil. Data science in action. In: Process mining. Springer, Berlin, Heidelberg, 2016. p. 3-23. 

VAN DER AALST, Wil. Process mining: Overview and opportunities. ACM Transactions on Management Information Systems (TMIS), v. 3, n. 2, p. 1-17, 2012. 

VOGELGESANG, Thomas; APPELRATH, H.-Jürgen. Multidimensional process mining: a flexible analysis approach for health services research. In: Proceedings of the Joint EDBT/ICDT 2013 Workshops. 2013. p. 17-22. 

Sair da versão mobile