P
prepair.app
Começar entrevista →
EnglishУкраїнськаРусскийDeutsch
📊

Junior Data ScientistPerguntas de entrevista data scientist

Junior · sem experiência / menos de 1 ano

As entrevistas de data science testam três coisas ao mesmo tempo: se você realmente entende estatística em vez de recitar definições, se consegue extrair e moldar dados sozinho com SQL e pandas, e se consegue transformar um modelo numa decisão sobre a qual alguém realmente vai agir. Aqui estão as perguntas mais frequentes, cada uma com uma resposta modelo. Junior: teoria básica, definições e casos práticos simples.

Experimente — sem necessidade de conta
Preparando sua pergunta…

Temas para se preparar

Fundamentos de estatística e probabilidade
Testes de hipótese, p-values, intervalos de confiança
SQL e manipulação de dados com pandas
Regressão, classificação, feature engineering
A/B testing e design de experimentos
Inferência causal e comunicação de resultados

6 perguntas de nível Junior com respostas

1

Qual é a diferença entre estatística populacional e amostral, e por que isso muda suas fórmulas?

Resposta

Uma estatística populacional descreve todos que interessam a você; uma estatística amostral a estima a partir de um subconjunto, e essa estimativa adiciona incerteza que um parâmetro populacional não tem. Isso aparece concretamente na variância: dividir por n-1 em vez de n na variância amostral (correção de Bessel) corrige um viés que, de outra forma, subestimaria sistematicamente a verdadeira variância populacional.

2

Qual é a diferença entre correlação e causalidade, em termos simples?

Resposta

Correlação significa que duas variáveis se movem juntas; causalidade significa que uma produz uma mudança na outra. Vendas de sorvete e mortes por afogamento correlacionam porque ambas sobem no calor do verão — nenhuma causa a outra. Tratar uma correlação como causal sem uma comparação controlada ou um mecanismo plausível é o erro analítico mais comum de analistas juniores.

3

Como você juntaria duas tabelas em SQL, e qual é a diferença entre INNER e LEFT JOIN?

Resposta

INNER JOIN mantém só as linhas que combinam na chave de junção em ambas as tabelas; LEFT JOIN mantém cada linha da tabela da esquerda e preenche com NULL onde não há correspondência à direita. Escolher INNER JOIN por padrão quando na verdade você quer LEFT JOIN descarta linhas silenciosamente — clientes sem pedidos simplesmente desaparecem em vez de aparecer com zero, o que enviesa silenciosamente qualquer agregação construída em cima.

4

O que uma distribuição normal te diz, e o que quebra essa suposição em dados reais?

Resposta

Uma distribuição normal é simétrica em torno da média, com cerca de 68% dos valores dentro de um desvio-padrão e 95% dentro de dois — ela fundamenta a maioria dos testes estatísticos clássicos. Dados reais de negócio muitas vezes não são normais: receita e duração de sessão são enviesados à direita com uma cauda longa, e contagens de eventos raros seguem mais um formato de Poisson, por isso você verifica a distribuição antes de assumir que um teste t é válido.

5

Qual é a diferença entre `.loc` e `.iloc` no pandas?

Resposta

.loc seleciona por rótulo — o índice real ou nome da coluna —, enquanto .iloc seleciona por posição inteira, independentemente de quais são os rótulos. Eles divergem dolorosamente depois de filtrar ou ordenar um DataFrame, porque a ordem posicional já não corresponde ao índice original; usar .iloc[0] ali te dá a primeira linha da view atual, não "índice 0".

6

O que é p-hacking, e como você evita fazer isso sem querer?

Resposta

P-hacking é rodar muitas análises — métricas diferentes, cortes diferentes dos dados, janelas de tempo diferentes — até uma cruzar p < 0,05, e então reportar só essa como se fosse o único teste planejado. Isso acontece sem querer quando você checa um dashboard todo dia e para no momento em que uma métrica parece significativa. A solução é pré-registrar o que você vai medir e quando vai olhar antes de os dados chegarem, não depois.

🦎

Só ler as respostas não basta

Numa entrevista de verdade você fala sob pressão. O Cam faz essas mesmas perguntas, avalia cada resposta e mostra exatamente o que melhorar.

Praticar entrevista de Junior Data Scientist →
Grátis · 3 entrevistas por mês

Outros níveis — Data Scientist

Middle Data ScientistSenior Data ScientistTodas as perguntas de Data Scientist

Outras especializações

🔍Junior QA Manual🤖Junior QA AutomationJunior Java Backend🐍Junior Python Backend🐘Junior PHP Backend🦫Junior Go Backend🟢Junior Node.js Backend💎Junior Ruby on Rails🟣Junior .NET Backend Developer🔷Junior C++