- Descrição do projeto
- Status do projeto
- Objetivos
- Pipeline analítico (o que foi feito)
- Principais insights
- Modelagem e previsão
- Tecnologias utilizadas
- Como executar
- Estrutura do repositório
- Próximos passos sugeridos
- Autoria
- Referências
Este repositório documenta um estudo completo de análise de dados sobre a CEAPS (Cota para Exercício da Atividade Parlamentar dos Senadores), consolidando o período de 2008 até 2026 via API.
O trabalho foi construído integralmente no notebook ceaps-data-analysis.ipynb, cobrindo:
- Data wrangling (coleta, limpeza, padronização e imputação);
- EDA e storytelling com foco em transparência dos gastos;
- Análise por legislatura, categoria, parlamentar e UF;
- Forecasting para projeção dos gastos dos próximos meses.
Este projeto foi desenvolvido como parte da trilha 7 Days of Code (Dados) da Alura, no desafio de Ciência de Dados com o dataset CEAPS.
✅ Concluído (versão analítica do notebook)
O notebook já contém todas as etapas implementadas, análises interpretadas e visualizações necessárias para reproduzir os resultados apresentados.
- Obter e consolidar a base CEAPS anual em um único dataset;
- Corrigir inconsistências de schema, encoding e nulos;
- Quantificar padrões de gastos por tempo, categoria e legislatura;
- Identificar sinais de opacidade em categorias sensíveis (ex.: consultorias);
- Comparar modelos de série temporal e gerar previsão de curto prazo.
- Consumo da API CEAPS para os anos de 2008 a 2026;
- União das bases anuais em um único dataframe;
- Exportação do consolidado para arquivo CSV.
- Correção de nomes de colunas;
- Padronização de tipos (
DATA, valores monetários etc.); - Tratamento de caracteres com problema de acentuação;
- Tratamento de nulos por coluna;
- Imputação de campos textuais faltantes, preservando a integridade analítica.
- Evolução anual do custo CEAPS e interpretação histórica (pandemia, ciclos eleitorais etc.);
- Custo médio mensal por senador e custo anual por cadeira;
- Perfil de gasto por categoria e comparação entre legislaturas;
- Ranking de parlamentares na 57ª legislatura (atual) com cautela metodológica para outliers de mandato parcial;
- Análise geográfica (UF) e mapas comparativos;
- Auditoria de opacidade para gastos sem detalhamento adicional.
- Construção da série mensal de gastos;
- Baseline simples por média histórica;
- Benchmark entre modelos: Regressão Linear, ARIMA, SARIMA e Prophet;
- Seleção do melhor modelo por MAPE e previsão dos próximos 3 meses.
- O projeto consolidou mais de 386 mil registros com qualidade final controlada no pipeline.
- A categoria Consultorias aparece como um dos principais vetores de gasto ao longo da série.
- Uma parcela relevante dos gastos em consultorias apresenta baixo detalhamento, reduzindo rastreabilidade.
- A hipótese logística (distância até Brasília) não explica sozinha os maiores volumes: comunicação e estrutura política têm peso importante.
- Na legislatura atual, o custo médio por cadeira do Senado em CEAPS se mantém em patamar elevado (ordem de ~R$ 1 milhão/ano por vaga, conforme métricas do notebook).
Foram comparados quatro modelos com janela de teste de 36 meses e métrica MAPE:
| Modelo | MAPE (%) |
|---|---|
| SARIMA | 10.52 |
| Regressão Linear | 12.48 |
| ARIMA | 15.27 |
| Prophet | 18.73 |
Modelo escolhido: SARIMA, por melhor desempenho preditivo e melhor captura de sazonalidade anual.
- Linguagem: Python
- Ambiente: Jupyter Notebook
- Bibliotecas de dados/modelagem:
pandas,numpyscikit-learnstatsmodelsprophet
- Visualização:
plotly - Coleta/integração:
requests,urllib
- Python 3.12.4
- Jupyter Notebook/Lab
# 1) Clone o repositório
git clone <[url-do-repositorio](https://github.com/barlettab/ceaps-data-analysis.git)>
cd ceaps-data-analysis
# 2) (Opcional, recomendado) Crie ambiente virtual
python -m venv .venv
source .venv/bin/activate # Linux/macOS
# 3) Instale dependências principais
pip install pandas numpy plotly scikit-learn statsmodels prophet requests urllib3 jupyter
# 4) Execute o notebook
jupyter notebook ceaps-data-analysis.ipynb+ceaps-data-analysis/
├── ceaps-data-analysis.ipynb # notebook principal com toda a análise
└── README.md # documentação do projeto
- Externalizar configuração (anos, filtros, parâmetros SARIMA) para arquivo
.yaml; - Criar
requirements.txt/pyproject.tomlpara reprodutibilidade formal; - Publicar dashboard final (ex.: Streamlit/Plotly Dash) com filtros por UF, legislatura e categoria;
- Automatizar atualização mensal.
+## Autoria Barbara Barletta Projeto de Ciência de Dados desenvolvido como estudo aplicado de análise de dados públicos com foco em transparência e previsão de gastos parlamentares.
- Base CEAPS (Dados Abertos do Senado):
- Kaggle Notebook:
- Alura 7 Days Of Code: