Skip to content

Latest commit

 

History

3 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

Análise e Modelagem de Dados da CEAPS

Python Jupyter Modelagem Data Science Analytics Status

Índice

Descrição do projeto

Este repositório documenta um estudo completo de análise de dados sobre a CEAPS (Cota para Exercício da Atividade Parlamentar dos Senadores), consolidando o período de 2008 até 2026 via API.

O trabalho foi construído integralmente no notebook ceaps-data-analysis.ipynb, cobrindo:

  • Data wrangling (coleta, limpeza, padronização e imputação);
  • EDA e storytelling com foco em transparência dos gastos;
  • Análise por legislatura, categoria, parlamentar e UF;
  • Forecasting para projeção dos gastos dos próximos meses.

Este projeto foi desenvolvido como parte da trilha 7 Days of Code (Dados) da Alura, no desafio de Ciência de Dados com o dataset CEAPS.

Status do projeto

Concluído (versão analítica do notebook)

O notebook já contém todas as etapas implementadas, análises interpretadas e visualizações necessárias para reproduzir os resultados apresentados.

Objetivos

  • Obter e consolidar a base CEAPS anual em um único dataset;
  • Corrigir inconsistências de schema, encoding e nulos;
  • Quantificar padrões de gastos por tempo, categoria e legislatura;
  • Identificar sinais de opacidade em categorias sensíveis (ex.: consultorias);
  • Comparar modelos de série temporal e gerar previsão de curto prazo.

Pipeline analítico (o que foi feito)

1) Coleta e consolidação

  • Consumo da API CEAPS para os anos de 2008 a 2026;
  • União das bases anuais em um único dataframe;
  • Exportação do consolidado para arquivo CSV.

2) Qualidade e tratamento dos dados

  • Correção de nomes de colunas;
  • Padronização de tipos (DATA, valores monetários etc.);
  • Tratamento de caracteres com problema de acentuação;
  • Tratamento de nulos por coluna;
  • Imputação de campos textuais faltantes, preservando a integridade analítica.

3) EDA + storytelling

  • Evolução anual do custo CEAPS e interpretação histórica (pandemia, ciclos eleitorais etc.);
  • Custo médio mensal por senador e custo anual por cadeira;
  • Perfil de gasto por categoria e comparação entre legislaturas;
  • Ranking de parlamentares na 57ª legislatura (atual) com cautela metodológica para outliers de mandato parcial;
  • Análise geográfica (UF) e mapas comparativos;
  • Auditoria de opacidade para gastos sem detalhamento adicional.

4) Forecasting

  • Construção da série mensal de gastos;
  • Baseline simples por média histórica;
  • Benchmark entre modelos: Regressão Linear, ARIMA, SARIMA e Prophet;
  • Seleção do melhor modelo por MAPE e previsão dos próximos 3 meses.

Principais insights

  • O projeto consolidou mais de 386 mil registros com qualidade final controlada no pipeline.
  • A categoria Consultorias aparece como um dos principais vetores de gasto ao longo da série.
  • Uma parcela relevante dos gastos em consultorias apresenta baixo detalhamento, reduzindo rastreabilidade.
  • A hipótese logística (distância até Brasília) não explica sozinha os maiores volumes: comunicação e estrutura política têm peso importante.
  • Na legislatura atual, o custo médio por cadeira do Senado em CEAPS se mantém em patamar elevado (ordem de ~R$ 1 milhão/ano por vaga, conforme métricas do notebook).

Modelagem e previsão

Foram comparados quatro modelos com janela de teste de 36 meses e métrica MAPE:

Modelo MAPE (%)
SARIMA 10.52
Regressão Linear 12.48
ARIMA 15.27
Prophet 18.73

Modelo escolhido: SARIMA, por melhor desempenho preditivo e melhor captura de sazonalidade anual.

Tecnologias utilizadas

  • Linguagem: Python
  • Ambiente: Jupyter Notebook
  • Bibliotecas de dados/modelagem:
    • pandas, numpy
    • scikit-learn
    • statsmodels
    • prophet
  • Visualização: plotly
  • Coleta/integração: requests, urllib

Como executar

Pré-requisitos

  • Python 3.12.4
  • Jupyter Notebook/Lab

Passos

# 1) Clone o repositório
git clone <[url-do-repositorio](https://github.com/barlettab/ceaps-data-analysis.git)>
cd ceaps-data-analysis

# 2) (Opcional, recomendado) Crie ambiente virtual
python -m venv .venv
source .venv/bin/activate  # Linux/macOS

# 3) Instale dependências principais
pip install pandas numpy plotly scikit-learn statsmodels prophet requests urllib3 jupyter

# 4) Execute o notebook
jupyter notebook ceaps-data-analysis.ipynb

Estrutura do repositório

+ceaps-data-analysis/
├── ceaps-data-analysis.ipynb   # notebook principal com toda a análise
└── README.md                   # documentação do projeto

Próximos passos sugeridos

  • Externalizar configuração (anos, filtros, parâmetros SARIMA) para arquivo .yaml;
  • Criar requirements.txt/pyproject.toml para reprodutibilidade formal;
  • Publicar dashboard final (ex.: Streamlit/Plotly Dash) com filtros por UF, legislatura e categoria;
  • Automatizar atualização mensal.

+## Autoria Barbara Barletta Projeto de Ciência de Dados desenvolvido como estudo aplicado de análise de dados públicos com foco em transparência e previsão de gastos parlamentares.

Referências

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages