<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Arquivo para Ciência de Dados - Bóson Treinamentos em Ciência e Tecnologia</title>
	<atom:link href="https://www.bosontreinamentos.com.br/category/ciencia-de-dados/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.bosontreinamentos.com.br/category/ciencia-de-dados/</link>
	<description>Artigos e Tutoriais sobre Desenvolvimento de Software, Bancos de Dados SQL, Linux, Lógica de Programação, Inteligência Artificial, Hardware, Eletrônica, Arduino, Técnicas e Teorias de Estudo e Aprendizagem, Carreira em TI, Ciências Cognitivas, e muito mais!</description>
	<lastBuildDate>Mon, 04 Sep 2023 17:09:20 +0000</lastBuildDate>
	<language>pt-BR</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=6.8.5</generator>
	<item>
		<title>Como usar o objeto Series da biblioteca Pandas em Python</title>
		<link>https://www.bosontreinamentos.com.br/programacao-em-python/como-usar-o-objeto-series-da-biblioteca-pandas-em-python/</link>
					<comments>https://www.bosontreinamentos.com.br/programacao-em-python/como-usar-o-objeto-series-da-biblioteca-pandas-em-python/?noamp=mobile#respond</comments>
		
		<dc:creator><![CDATA[Fábio dos Reis]]></dc:creator>
		<pubDate>Mon, 04 Sep 2023 17:09:20 +0000</pubDate>
				<category><![CDATA[Ciência de Dados]]></category>
		<category><![CDATA[Programação em Python]]></category>
		<category><![CDATA[Big Data]]></category>
		<category><![CDATA[Data Science]]></category>
		<category><![CDATA[Python]]></category>
		<guid isPermaLink="false">http://www.bosontreinamentos.com.br/?p=19627</guid>

					<description><![CDATA[<p>Como usar o objeto Series da biblioteca Pandas para análise de dados em Python O módulo Pandas é uma biblioteca de código aberto em Python que fornece estruturas de dados e ferramentas para análise de dados eficientes e bastante flexíveis. Essa biblioteca é amplamente empregada em tarefas de manipulação, limpeza, análise e transformação de dados em projetos diversos de ciência de dados, análise de dados e engenharia de software em geral. O Pandas possui duas estruturas de dados principais: os objetos Series e DataFrame. Neste tutorial vamos trabalhar com o objeto Series, e na próxima lição, abordaremos o objeto DataFrame. Objeto Series Um Series (&#8220;Série&#8221;) é um objeto do tipo array unidimensional contendo uma sequência de valores (semelhante a uma lista ou um array do NumPy) e um array associado de rótulos (labels) de dados, chamado de índice. Ou seja, trata-se de uma estrutura de dados simples cujos valores são armazenados na forma de uma coluna de dados, porém contendo uma coluna de valores de índice associados. Outra forma de pensar em um Series é como um dicionário ordenado de tamanho fixo, como se fosse um mapeamento entre valores de índices e valores de dados. Ele pode inclusive ser utilizada em [...]</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/programacao-em-python/como-usar-o-objeto-series-da-biblioteca-pandas-em-python/">Como usar o objeto Series da biblioteca Pandas em Python</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></description>
										<content:encoded><![CDATA[<h2>Como usar o objeto Series da biblioteca Pandas para análise de dados em Python</h2>
<p>O módulo Pandas é uma biblioteca de código aberto em Python que fornece estruturas de dados e ferramentas para análise de dados eficientes e bastante flexíveis. Essa biblioteca é amplamente empregada em tarefas de manipulação, limpeza, análise e transformação de dados em projetos diversos de ciência de dados, análise de dados e engenharia de software em geral.</p>
<p>O Pandas possui duas estruturas de dados principais: os objetos Series e DataFrame. Neste tutorial vamos trabalhar com o objeto Series, e na próxima lição, abordaremos o objeto DataFrame.</p>
<h3>Objeto Series</h3>
<p>Um Series (&#8220;Série&#8221;) é um objeto do tipo array unidimensional contendo uma sequência de <strong>valores</strong> (semelhante a uma lista ou um array do NumPy) e um array associado de rótulos (<em>labels</em>) de dados, chamado de <strong>índice</strong>.</p>
<p>Ou seja, trata-se de uma estrutura de dados simples cujos valores são armazenados na forma de uma coluna de dados, porém contendo uma coluna de valores de índice associados.</p>
<p>Outra forma de pensar em um Series é como um dicionário ordenado de tamanho fixo, como se fosse um mapeamento entre valores de índices e valores de dados. Ele pode inclusive ser utilizada em alguns contextos em que um dicionário seria empregado.</p>
<p>No geral, usamos Series para guardar dados sobre um atributo em particular no dataset, sendo possível extrair uma coluna de um DataFrame na forma de um objeto Series, ou ainda adicionar uma coluna a um DataFrame a partir de um Series.</p>
<h3>Como importar a biblioteca Pandas</h3>
<p>Para que possamos criar e usar um objeto Series, primeiramente devemos importar o módulo Pandas (que deve estar instalado):</p>
<pre><strong>import pandas as pd</strong></pre>
<p>Caso o módulo Pandas não esteja instalado, use um gerenciador de pacotes como o pip ou conda para realizar sua instalação, como segue:</p>
<pre><strong>pip install pandas</strong></pre>
<p>ou (se estiver usando o Anaconda / Miniconda)</p>
<pre><strong>conda install pandas</strong></pre>
<h3>Como criar um objeto Series</h3>
<p>Podemos criar um objeto Series de várias maneiras, incluindo a partir de listas, dicionários, arrays NumPy e até mesmo criar Series vazias. Vejamos cada uma dessas formas com um exemplo.</p>
<h4>Criar objeto Series vazio invocando o método Series()</h4>
<pre><span style="color: #339966;"><strong># Objeto Series vazio</strong></span>
<strong>serie = pd.Series()</strong>
<strong>print(serie)</strong></pre>
<h4>Criar Series a partir de uma lista comum</h4>
<p>Uma forma mais comum é criar um objeto Series passando algum tipo de array de dados, como uma lista de valores:</p>
<pre><span style="color: #339966;"><strong># Series com lista do Python</strong></span>
<strong>dados = pd.Series([12, 34, 21, -9, 0, 7])</strong>
<strong>print(dados)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">0    12
1    34
2    21
3    -9
4     0
5     7
dtype: int64</span></pre>
<h4>Criar objeto Series a partir de um array NumPy</h4>
<p>Podemos ainda passar um array NumPy para criar um Series (a biblioteca NumPy deve estar instalada para que o exemplo a seguir funcione):</p>
<pre><span style="color: #339966;"><strong># Series com array NumPy</strong></span>
<strong>import numpy as np

</strong><strong>array_numpy = np.array([10, 20, 30, 40, 50, 60])</strong>
<strong>dados = pd.Series(array_numpy)</strong>
<strong>print(dados)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">0    10
1    20
2    30
3    40
4    50
5    60
dtype: int32</span></pre>
<h4>Criar Series preenchida com valores repetidos</h4>
<p>Além disso, podemos criar um Series preenchido com um dado repetido para todos os índices:</p>
<pre><span style="color: #339966;"><strong># Series com repetição de itens</strong></span>
<strong>serie = pd.Series(33, index = ["num1", "num2", "num3", "num4", "num5"])</strong>
<strong>print(serie)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">num1    33
num2    33
num3    33
num4    33
num5    33
dtype: int64</span></pre>
<h4>Criar Series a partir de um dicionário</h4>
<p>Finalmente, podemos criar um objeto Series passando um dicionário como parâmetro. Neste caso, as chaves serão usadas como índices e os valores serão os itens:</p>
<pre><strong><span style="color: #339966;"># Series com dicionário</span></strong>
<strong>dicionario = {</strong>
<strong>    'Ano' :1950,</strong>
<strong>    'Item' : 'TV',</strong>
<strong>    'Valor' : 250.60</strong>
<strong>}

</strong><strong>serie = pd.Series(dicionario)</strong>
<strong>print(serie)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Ano       1950
Item        TV
Valor    250.6
dtype: object</span></pre>
<p><em>Outro exemplo de dicionário</em></p>
<pre><strong>dicionario = {'Brasil': 5, 'EUA': 0, 'Inglaterra': 1, 'Argentina': 3}</strong>
<strong>dados = pd.Series(dicionario)</strong>
<strong>print(dados)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Brasil        5
EUA           0
Inglaterra    1
Argentina     3
dtype: int64</span></pre>
<h3>Valores e índices</h3>
<p>A representação em string de uma Series exibida interativamente mostra o índice à esquerda e os valores à direita. Como não especificamos um índice para os dados, um índice default constituído dos inteiros de 0 a n-1 (em que n é o tamanho dos dados) é criado.</p>
<p>Podemos obter a representação do array e o objeto de índice de Series por meio de seus atributos de valores (<strong><em>values</em></strong>) e de índice (<em><strong>index</strong></em>), respectivamente:</p>
<pre><span style="color: #ff0000;"><strong>print('Dados: ', dados.values)</strong>
<strong>print('Índices: ', dados.index)</strong></span></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Dados:  [5 0 1 3]
Índices:  Index(['Brasil', 'EUA', 'Inglaterra', 'Argentina'], dtype='object')</span></pre>
<h3>Criar índices personalizados</h3>
<p>Com frequência, precisamos criar um Series com um índice que identifique cada ponto de dado com um rótulo. Neste caso passamos o parâmetro index=[] contendo uma lista de valores que serão usados como índices:</p>
<pre><strong>dados = pd.Series([12, 34, 21, -9, 0, 7], index=['a','b','c','d','e','f'])</strong>
<strong>print(dados)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">a    12
b    34
c    21
d    -9
e     0
f     7
dtype: int64</span></pre>
<p>Podemos usar rótulos no índice quando selecionamos valores únicos ou um conjunto de valores:</p>
<pre><strong>print('Dado no índice c: ', dados['c'])</strong>
<strong>print('\nÍndices b e e:')</strong>
<strong>print(dados[['b','e']])</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Dado no índice c:  21

Índices b e e:
b    34
e     0
dtype: int64</span></pre>
<h3>Operações Gerais em objetos Series</h3>
<p>Agora que sabemos como criar e acessar objetos Series do Pandas, vamos conhecer algumas operações básicas que podemos realizar sobre os índices e dados armazenados na estrutura.</p>
<h4>1. Acessar um item</h4>
<p>Podemos acessar itens (valores) usando número de posição de índice ou nome de índice (se aplicado):</p>
<pre><strong>serie = pd.Series([10, 20, 30, 40, 50], index = ["num1", "num2","num3", "num4", "num5"])</strong>
<strong>print('Item na posição 0: ', serie[0])</strong>
<strong>print('Item de índice num3: ', serie['num3'])</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Item na posição 0:  10
Item de índice num3:  30</span></pre>
<h4>2. Descobrir valores máximo e mínimo</h4>
<p>Podemos retornar os valores máximo e mínimo de um objeto Series com o emprego dos métodos .max() e .min():</p>
<pre><strong>serie = pd.Series([5, 7, 12, 2, 1, 6, 7, 0, -3, 22])</strong>
<strong>print(f'Menor valor: {serie.min()}')</strong>
<strong>print(f'Valor mais alto: {serie.max()}')</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Menor valor: -3
Valor mais alto: 22</span></pre>
<p>Para obter o índice associado ao maior valor usamos o método <em>.idxmax()</em> e o índice do menor valor com <em>.idxmin()</em>:</p>
<pre><strong>serie = pd.Series([5, 7, 12, 2, 1, 6, 7, 0, -3, 22])</strong>
<strong>print(f'Valor mais alto: {serie.max()}')</strong>
<strong>print(f'Índice do maior valor: {serie.idxmax()}')</strong>
<strong>print(f'Índice do menor valor: {serie.idxmin()}')</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Valor mais alto: 22
Índice do maior valor: 9
Índice do menor valor: 8</span></pre>
<h4>3. Funções de Estatística Descritiva</h4>
<p>Diversas funções de estatística descritiva estão disponíveis em objetos Series, na forma de métodos associados, como Média Aritmética Simples, Mediana e Somatório, entre outras.</p>
<p>A média aritmética pode ser obtida com o método .mean():</p>
<pre><strong>print(f'Média aritmética: {serie.mean()}')</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Média aritmética: 5.9</span></pre>
<p>A mediana com .median():</p>
<pre><strong>print(f'Mediana dos valores: {serie.median()}')</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Mediana dos valores: 5.5</span></pre>
<p>E o somatório dos valores com .sum():</p>
<pre><strong>print(f'Somatório dos valores: {serie.sum()}')</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Somatório dos valores: 59</span></pre>
<h4>4. Converter objeto Series em lista comum do Python</h4>
<p>Podemos converter um objeto Series em uma lista comum do Python com o método .tolist():</p>
<pre><strong>serie = pd.Series([5, 7, 12, 2, 1, 6, 7, 0, -3, 22])

</strong><span style="color: #339966;"><strong># Ver objeto Series</strong></span>
<strong>print(serie)

</strong><span style="color: #339966;"><strong># Criar lista a partir de Series</strong></span>
<strong>lista = serie.tolist()

</strong><span style="color: #339966;"><strong># Ver lista criada</strong></span>
<strong>print('Lista: ', lista)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">0     5
1     7
2    12
3     2
4     1
5     6
6     7
7     0
8    -3
9    22
dtype: int64
Lista:  [5, 7, 12, 2, 1, 6, 7, 0, -3, 22]</span></pre>
<h4>5. Mostrar apenas os primeiros e últimos itens da Series</h4>
<p>Se a quantidade de itens no objeto Series for grande, talvez você queira ver apenas os primeiros valores para ter uma ideia da natureza dos dados. Neste caso, pode usar o método head(), que retorna os cinco primeiros itens da série.</p>
<pre><strong>print(serie.head())</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">0     5
1     7
2    12
3     2
4     1
dtype: int64</span></pre>
<p>Da mesma forma, para mostrar os cinco últimos elementos, usamos o método <strong>.tail()</strong></p>
<p>Dependendo da quantidade de itens, o Pandas retorna automaticamente apenas os cinco primeiros e os cinco últimos, sem a necessidade de usar o método .head().</p>
<p>No exemplo a seguir geramos 1000 números aleatórios usando a biblioteca NumPy, e criamos um Series do Pandas com esses valores. Na sequência, imprimimos os valores na tela &#8211; somente os cinco primeiros e cinco últimos devem aparecer neste caso, mesmo sem usar os métodos head() e tail():</p>
<pre><strong>import pandas as pd
</strong><strong>from numpy import random

</strong><strong>lista = []</strong>
<strong>for i in range(1000):</strong>
<strong>    lista.append(random.randint(250))</strong>
<strong>dados = pd.Series(lista)</strong>
<strong>print(dados)</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">0        0
1       39
2      161
3      125
4      147
      ... 
995     24
996     95
997    165
998    144
999     45
Length: 1000, dtype: int64</span></pre>
<h4>6. Mostrar os elementos ordenados por valores de índice: método .sort_index()</h4>
<pre><strong>dicionario = {'Brasil': 5, 'EUA': 0, 'Inglaterra': 1, 'Argentina': 3}</strong>
<strong>dados = pd.Series(dicionario)</strong>
<strong>print(dados.sort_index())</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">Argentina     3
Brasil        5
EUA           0
Inglaterra    1
dtype: int64</span></pre>
<h4>7. Mostrar os elementos ordenados por valores dos itens: método .sort_values()</h4>
<pre><strong>dicionario = {'Brasil': 5, 'EUA': 0, 'Inglaterra': 1, 'Argentina': 3}</strong>
<strong>dados = pd.Series(dicionario)</strong>
<strong>print(dados.sort_values())</strong></pre>
<p>Saída:</p>
<pre><span style="color: #000000;">EUA           0
Inglaterra    1
Argentina     3
Brasil        5
dtype: int64</span></pre>
<p>Vamos praticar um pouco agora.</p>
<h3>Dataset para exercícios</h3>
<p>Escreva um código que gere um objeto Series do Pandas, contendo uma lista com todos os países da União Europeia e suas respectivas populações, com os nomes dos países sendo usados como índices.</p>
<pre><span style="color: #339966;"><strong># Dicionário contendo os países da União Europeia e suas populações</strong></span>
<strong>dados = {</strong>
<strong>'Austria': 9006398,</strong>
<strong>'Alemanha': 83289318,</strong>
<strong>'Bélgica': 11589623,</strong>
<strong>'Bulgária': 7000039,</strong>
<strong>'Chipre': 1207361,</strong>
<strong>'Croácia': 4076246,</strong>
<strong>'Dinamarca': 5806015,</strong>
<strong>'Eslováquia': 5459642,</strong>
<strong>'Eslovênia': 2095861,</strong>
<strong>'Espanha': 47351567,</strong>
<strong>'Estônia': 1324820,</strong>
<strong>'Finlândia': 5523231,</strong>
<strong>'França': 66977107,</strong>
<strong>'Grécia': 10423056,</strong>
<strong>'Hungria': 9775564,</strong>
<strong>'Irlanda': 4882495,</strong>
<strong>'Itália': 60233948,</strong>
<strong>'Letônia': 1906743,</strong>
<strong>'Lituânia': 2793471,</strong>
<strong>'Luxemburgo': 613894,</strong>
<strong>'Malta': 493559,</strong>
<strong>'Países Baixos': 17134872,</strong>
<strong>'Polônia': 37974750,</strong>
<strong>'Portugal': 10286263,</strong>
<strong>'República Tcheca': 10693939,</strong>
<strong>'Romênia': 19405156,</strong>
<strong>'Suécia': 10106005,</strong>
<strong>}

</strong><span style="color: #339966;"><strong># Criar um objeto Series a partir do dicionário</strong></span>
<strong>populacao_ue = pd.Series(dados)

</strong><span style="color: #339966;"><strong># Exibir o objeto Series</strong></span>
<strong>print(populacao_ue)</strong></pre>
<h3>Exercícios: Series do Pandas</h3>
<p>Vamos treinar agora. Para os próximos exercícios, use o Series <em><strong>populacao_ue</strong></em> criado anteriormente. As respostas estão na sequência, com códigos sugeridos.</p>
<p>01. Imprimir a população da França.</p>
<p>02. Imprimir a lista de países da União Europeia em ordem alfabética.</p>
<p>03. Calcular e imprimir o número total de países na União Europeia.</p>
<p>04. Calcular e imprimir a população média dos países da União Europeia. Mostrar o resultado com duas casas decimais apenas.</p>
<p>05. Encontrar e imprimir o país com a maior população na União Europeia.</p>
<p>06. Filtrar e imprimir os países da União Europeia com população acima de 10 milhões, mostrando o resultado em ordem alfabética de nome de país.</p>
<p>07. Calcular e imprimir a população total da União Europeia.</p>
<p>08. Calcular e imprimir a porcentagem da população da Espanha em relação à população total da União Europeia.</p>
<p>09. Ordenar a Series em ordem decrescente de população e imprimir os cinco primeiros países.</p>
<p>10. Criar uma nova Series com a população de apenas três países da União Europeia e calcular a média da população desses países.<br />
Use como exemplos os países França, Alemanha e Croácia.</p>
<p>11. Como exibir apenas as últimas três linhas do Series Pandas de nome &#8220;populacao_ue&#8221;?<br />
A. populacao_ue(3:)<br />
B. populacao_ue(1:3)<br />
C. populacao_ue(-3:)<br />
D. populacao_ue(:3)<br />
E. populacao_ue(+3)</p>
<p>12. Podemos criar um objeto Series do Pandas usando:<br />
A. Array NumPy<br />
B. Lista<br />
C. Dicionário<br />
D. Valores repetidos<br />
E. Todos os anteriores</p>
<h3>RESPOSTAS DOS EXERCÍCIOS</h3>
<p>01.</p>
<pre><strong>print(populacao_ue['França'])</strong></pre>
<p>02.</p>
<pre>print(populacao_ue.sort_index())</pre>
<p>03.</p>
<pre>numero_paises = len(populacao_ue.index)
print("Número de países na União Europeia:", numero_paises)</pre>
<p>04.</p>
<pre>populacao_media = populacao_ue.mean()
print(f'População média dos países da União Europeia: {round(populacao_media, 2)}')</pre>
<p>05.</p>
<pre>pais_maior_populacao = populacao_ue.idxmax()
print("País com maior população na União Europeia:", pais_maior_populacao)</pre>
<p>06.</p>
<pre><span style="color: #339966;"># Filtrar os países da União Europeia com população acima de 10 milhões</span>
paises_mais_10M = populacao_ue[populacao_ue &gt; 10000000]

<span style="color: #339966;"># Ordenar os países filtrados em ordem alfabética e imprimir</span>
paises_ordenados = paises_mais_10M.sort_index()
print("Países da União Europeia com população acima de 10 milhões, em ordem alfabética:")
print(paises_ordenados)</pre>
<p>07.</p>
<pre>print(f'População total da União Europeia: {populacao_ue.sum()} habitantes')</pre>
<p>08.</p>
<pre>populacao_espanha = populacao_ue['Espanha']
populacao_total = populacao_ue.sum()
porcentagem_espanha = (populacao_espanha / populacao_total) * 100
print(f'População da Espanha em relação à população da UE: {porcentagem_espanha:.02f}%')</pre>
<p>09.</p>
<pre>paises_mais_populosos = populacao_ue.sort_values(ascending=False)
print("Cinco primeiros países mais populosos:")
print(paises_mais_populosos.head())</pre>
<p>10.</p>
<pre>paises_selecionados = populacao_ue[['França', 'Alemanha', 'Croácia']]
media_populacao_selecionados = paises_selecionados.mean()
print("Média da população:", media_populacao_selecionados)</pre>
<p>11.</p>
<pre>C. populacao_ue(-3:)</pre>
<p>12.</p>
<pre>E. Todos os anteriores</pre>
<p>É isso aí! No próximo tutorial vamos apresentar o objeto DataFrame (df) do Pandas, mostrando como criar um dataframe e como manipular seu conteúdo pode meio dos métodos e propriedades disponíveis.</p>
<p>&nbsp;</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/programacao-em-python/como-usar-o-objeto-series-da-biblioteca-pandas-em-python/">Como usar o objeto Series da biblioteca Pandas em Python</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.bosontreinamentos.com.br/programacao-em-python/como-usar-o-objeto-series-da-biblioteca-pandas-em-python/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>O que é um Dataset</title>
		<link>https://www.bosontreinamentos.com.br/ciencia-de-dados/o-que-e-um-dataset/</link>
					<comments>https://www.bosontreinamentos.com.br/ciencia-de-dados/o-que-e-um-dataset/?noamp=mobile#respond</comments>
		
		<dc:creator><![CDATA[Fábio dos Reis]]></dc:creator>
		<pubDate>Tue, 22 Mar 2022 18:11:27 +0000</pubDate>
				<category><![CDATA[Ciência de Dados]]></category>
		<category><![CDATA[Bancos de Dados]]></category>
		<category><![CDATA[Big Data]]></category>
		<category><![CDATA[Data Science]]></category>
		<guid isPermaLink="false">http://www.bosontreinamentos.com.br/?p=18151</guid>

					<description><![CDATA[<p>O que é um Dataset Se você estuda ou pesquisa materiais relacionados a bancos de dados ou ciência de dados (ou áreas correlatas), já deve ter se deparado com o termo &#8220;dataset&#8221; em algum momento. Talvez até já tenha utilizado um em algum projeto, mesmo que não se lembre do fato. Mas, o que é um data set? Será o mesmo que um database (banco de dados)? Qual a relação entre dataset e database? E quanto de &#8220;data&#8221; (dados) é necessário para termos um um &#8220;set&#8221; (conjunto) deles? Vou responder a essas e  outras perguntas sobre o assunto neste artigo.  Coleções de dados Um data set (ou ainda dataset) é, basicamente, uma coleção de dados. Esses dados podem ser tabulares (na forma de uma tabela), como os encontrados em bancos de dados relacionais, ou ainda podem ser coleções de arquivos ou documentos em formatos variados. Um grupo de registros pode ser chamado de data set. Em um dataset podemos armazenar os mais variados tipos de informações, tais como registros médicos, dados de sensores, informações científicas, dados estatísticos como dados de censos, e muitas outras. Esses dados são então utilizados por aplicações para realizar processos de análise, com o intuito de obter [...]</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/ciencia-de-dados/o-que-e-um-dataset/">O que é um Dataset</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></description>
										<content:encoded><![CDATA[<h2>O que é um Dataset</h2>
<p><span style="font-weight: 400;">Se você estuda ou pesquisa materiais relacionados a bancos de dados ou ciência de dados (ou áreas correlatas), já deve ter se deparado com o termo &#8220;dataset&#8221; em algum momento. Talvez até já tenha utilizado um em algum projeto, mesmo que não se lembre do fato.</span></p>
<p><span style="font-weight: 400;">Mas, o que é um data set? Será o mesmo que um database (banco de dados)? Qual a relação entre dataset e database? E quanto de &#8220;data&#8221; (dados) é necessário para termos um um &#8220;set&#8221; (conjunto) deles?</span></p>
<p>Vou responder a essas e  outras perguntas sobre o assunto neste artigo. </p>
<h3>Coleções de dados</h3>
<p><span style="font-weight: 400;">Um <em><strong>data set</strong></em> (ou ainda <em>dataset</em>) é, basicamente, uma coleção de dados.</span></p>
<p><span style="font-weight: 400;">Esses dados podem ser tabulares (na forma de uma tabela), como os encontrados em bancos de dados relacionais, ou ainda podem ser coleções de arquivos ou documentos em formatos variados.</span></p>
<p><span style="font-weight: 400;">Um grupo de registros pode ser chamado de data set. Em um dataset podemos armazenar os mais variados tipos de informações, tais como registros médicos, dados de sensores, informações científicas, dados estatísticos como dados de censos, e muitas outras.</span></p>
<p><span style="font-weight: 400;">Esses dados são então utilizados por aplicações para realizar processos de análise, com o intuito de obter informações e novos insights para um negócio.</span></p>
<h3><strong>Onde conseguimos um Data set?</strong></h3>
<p><span style="font-weight: 400;">Diversos data sets estão disponíveis para uso pelo público, para pesquisas ou simplesmente aprendizado de alguma tecnologia como <a href="https://youtu.be/JPC5mE9iI0I" target="_blank" rel="noopener">Big Data</a>, Machine Learning ou <a href="http://www.bosontreinamentos.com.br/bancos-de-dados/o-que-e-um-banco-de-dados-relacional/">Bancos Relacionais</a>.</span></p>
<p><span style="font-weight: 400;">Exemplos incluem:</span></p>
<ul>
<li><a href="https://archive.ics.uci.edu/ml/datasets/Iris" target="_blank" rel="noopener"><span style="font-weight: 400;">Dataset Iris Flower</span></a></li>
<li><a href="http://yann.lecun.com/exdb/mnist/" target="_blank" rel="noopener"><span style="font-weight: 400;">Banco MNIST</span></a></li>
</ul>
<p><span style="font-weight: 400;">Alguns sites disponibilizam e permitem a publicação de data sets abertos (ou com algum custo), como por exemplo:</span></p>
<ul>
<li><span style="font-weight: 400;"><a href="https://datahub.io/" target="_blank" rel="noopener">Data Hub</a> &#8211; Diretório de data sets abertos gerenciado por uma comunidade</span></li>
<li><a href="https://data.worldbank.org/" target="_blank" rel="noopener">World Bank Open Data</a> &#8211; Dados de Desenvolvimento Mundial do Banco Mundial</li>
<li><a href="https://data.gov/" target="_blank" rel="noopener">DATA.GOV</a> &#8211; Dados abertos do governo dos Estados Unidos da América </li>
<li><a href="https://dados.gov.br/dataset" target="_blank" rel="noopener">dados.gov.br</a> &#8211; Portal Brasileiro de Dados abertos </li>
<li><a href="https://www.imf.org/en/Data" target="_blank" rel="noopener">IMF Data</a> &#8211; Dados do Fundo Monetário Internacional (FMI)</li>
<li><a href="https://www.kaggle.com/datasets" target="_blank" rel="noopener">Kaggle Datasets</a> &#8211; Sistema de busca de data sets do Kaggle</li>
</ul>
<p>Os datasets podem ser gerados a partir de inúmeras fontes de dados distintas, como por exemplo dados de compras realizadas pelos usuários de uma loja, avaliações desses usuários sobre os produtos ou serviços adquiridos, preenchimento de formulários e pesquisas online (ou físicas), oriundos de sistemas eletrônicos como sensores de dados físicos, e muitas outras.</p>
<h3>Como é composto um Dataset</h3>
<p>No geral, um data set consiste de dois componentes básicos: linhas e colunas, mas não exatamente como em uma planilha. Comumente, cada linha de um data set contém dados a respeito de uma informação em particular &#8211; similar a uma tabela, mas não necessariamente idêntico. É comum o emprego de arquivos CSV (valores separados por vírgulas) para a criação de datasets.</p>
<p>Como exemplo, podemos considerar o fragmento de conjunto de dados a seguir, que trata de elementos químicos da tabela periódica. Trata-se de uma tabela de dados, na forma de uma planilha, que pode ser importada em programas de análise de dados e manipulada com o emprego de técnicas, funções e bibliotecas específicas.</p>
<div id="attachment_18152" style="width: 709px" class="wp-caption aligncenter"><img decoding="async" aria-describedby="caption-attachment-18152" class="wp-image-18152" title="Data Set de Elementos Químicos - Bóson Treinamentos" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-elementos-quimicos.png" alt="Data Set de Elementos Químicos - Bóson Treinamentos" width="699" height="192" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-elementos-quimicos.png 954w, https://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-elementos-quimicos-420x115.png 420w, https://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-elementos-quimicos-768x211.png 768w" sizes="(max-width: 699px) 100vw, 699px" /><p id="caption-attachment-18152" class="wp-caption-text">Data Set de Elementos Químicos &#8211; Bóson Treinamentos</p></div>
<p>Neste exemplo, cada coluna se refere a uma propriedade específica dos elementos químicos, e cada linha contém o conjunto de propriedades de um elemento em particular. Para cada elemento há uma linha de dados.</p>
<p>Já o fragmento do <a href="https://github.com/openfootball/worldcup" target="_blank" rel="noopener">data set openfootball</a> a seguir, armazenado no Github e descoberto a partir do Data Hub, traz dados sobre as finais da Copa do Mundo de Futebol masculino de 1994, realizada nos EUA.</p>
<p>Note que o formato é diferente do exemplo anterior (elementos químicos), tratando-se de um arquivo de texto puro:</p>
<div id="attachment_18154" style="width: 663px" class="wp-caption aligncenter"><img loading="lazy" decoding="async" aria-describedby="caption-attachment-18154" class="wp-image-18154 size-full" title="Data Set Copa do Mundo 1994" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-copa-mundo-eua.png" alt="Data Set Copa do Mundo 1994" width="653" height="433" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-copa-mundo-eua.png 653w, https://www.bosontreinamentos.com.br/wp-content/uploads/2022/03/data-set-copa-mundo-eua-420x278.png 420w" sizes="auto, (max-width: 653px) 100vw, 653px" /><p id="caption-attachment-18154" class="wp-caption-text">Dados da Copa do Mundo 1994 do Data Set OpenFootball</p></div>
<p>Porém, os dados ainda assim estão armazenados em um formato tabular, com cada linha no geral remetendo a uma partida específica, e cada coluna a uma informação sobre as partidas.</p>
<p>A última linha (linha 41) mostra os dados da final entre Brasil e Itália, e podemos ver que a partida foi realizada no Rose Bowl, em Pasadena, com vitória do Brasil por 3 a 2 nos pênaltis, após empate em 0 x 0 no tempo normal e prorrogação*</p>
<p><em>*dia memorável, quebrei o lustre da sala da casa de meus avós com uma cabeçada (sem querer) após o pênalti de R. Baggio, ao dar um pulo para comemorar.</em></p>
<h3>Ferramentas usadas para analisar data sets</h3>
<p>Muitas ferramentas podem ser empregadas na análise e uso dos dados de um data set, com algumas das mais comuns listadas a seguir:</p>
<ul>
<li>Bibliotecas das linguagens R e <a href="http://www.bosontreinamentos.com.br/category/programacao-em-python/">Python</a> (como o Pandas)</li>
<li>Tableau</li>
<li>Microsoft Excel</li>
<li>Power BI</li>
<li>QlikView</li>
<li>RapidMiner</li>
<li><a href="http://www.bosontreinamentos.com.br/curso-completo-de-mysql/">Linguagem SQL</a></li>
</ul>
<p>entre muitos outros pacotes de software e bibliotecas de funções.</p>
<h3>Diferença entre Dado, Dataset e Banco de Dados</h3>
<p>É muito comum confundir esses termos, pois se referem a conceitos similares entre si. Mas eles <em>não são a mesma coisa</em>. Qual a diferença então entre Data set, Dados e Bancos de Dados (Database)?</p>
<p>Vejamos:</p>
<ul>
<li><a href="http://www.bosontreinamentos.com.br/modelagem-de-dados/conceitos-de-dados-informacoes-e-bancos-de-dados/"><strong>Dados</strong></a> são observações ou medições brutas (não processadas ou processadas) representadas como texto, números ou outros formatos.</li>
<li><strong>Data set</strong> é uma coleção estruturada de dados, geralmente associados a um assunto específico.</li>
<li>Já um <strong><a href="http://www.bosontreinamentos.com.br/bancos-de-dados/o-que-e-um-banco-de-dados-relacional/">Banco de Dados</a></strong> é uma coleção organizada de dados, que podem ser armazenados na forma de datasets correlacionados. Esses conjuntos de dados são geralmente armazenados e acessados eletronicamente a partir de um sistema informatizado (como um SGBD) que permite que os dados sejam facilmente acessados, manipulados e atualizados.</li>
</ul>
<h3>Conclusão</h3>
<p>Um dataset é um conjunto de dados tabulados e organizados em um arquivo de formato específico (.csv, .xls, .botxt, etc.), empregado em várias áreas das ciências de dados como fonte de informação para pesquisa, estudo, obtenção de informações e treinamento de sistemas de aprendizado de máquina (machine learning) e inteligência artificial, entre outros.</p>
<p>E, falando em Ciência de Dados, quais linguagens de programação são as mais indicadas para trabalhar nessa área? Confira neste artigo: <a href="http://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/">7 linguagens de programação para Ciência de Dados</a>.</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/ciencia-de-dados/o-que-e-um-dataset/">O que é um Dataset</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.bosontreinamentos.com.br/ciencia-de-dados/o-que-e-um-dataset/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>7 Linguagens de programação para Ciência de Dados &#8211; 2021</title>
		<link>https://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/</link>
					<comments>https://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/?noamp=mobile#comments</comments>
		
		<dc:creator><![CDATA[Fábio dos Reis]]></dc:creator>
		<pubDate>Tue, 23 Mar 2021 15:44:49 +0000</pubDate>
				<category><![CDATA[Carreira]]></category>
		<category><![CDATA[Ciência de Dados]]></category>
		<category><![CDATA[Análise de Dados]]></category>
		<category><![CDATA[Big Data]]></category>
		<category><![CDATA[Data Science]]></category>
		<category><![CDATA[Julia]]></category>
		<category><![CDATA[Octave]]></category>
		<category><![CDATA[Python]]></category>
		<guid isPermaLink="false">http://www.bosontreinamentos.com.br/?p=17644</guid>

					<description><![CDATA[<p>7 Linguagens de programação para Ciência de Dados &#8211; 2021 A ciência de dados é uma área do conhecimento que envolve o estudo e a análise de dados dos mais variados tipos, incluindo financeiros, científicos, sociais e econômicos. Seu intuito é a extração de conhecimento, descoberta de informações ocultas e detecção de padrões em conjuntos de dados para auxiliar na tomada de decisões e gerar valor para o negócio. Por conta disso,&#160;uma das profissões / carreiras mais em alta na atualidade é o cargo de Cientista de Dados.&#160; Um cientista de dados precisa ter um leque de conhecimentos diverso, combinando expertise em várias áreas do conhecimento, como matemática (principalmente estatística e probabilidade), conhecimentos específicos da área do negócio e, naturalmente, linguagens de programação para a criação de algoritmos e aplicações de software que são empregados no dia-a-dia. E aqui surge a dúvida mais comum entre os aspirantes à ciência de dados: que linguagem de programação aprender? Dada a quantidade de opções existentes, incluindo linguagens de uso geral e linguagens de nicho, quais linguagens de programação seriam mais apropriadas para uso em ciência de dados? Para ajudar a responder a essas perguntar e dar um direcionamento aos interessados na área, listo [...]</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/">7 Linguagens de programação para Ciência de Dados &#8211; 2021</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></description>
										<content:encoded><![CDATA[<h2>7 Linguagens de programação para Ciência de Dados &#8211; 2021</h2>
<p>A ciência de dados é uma área do conhecimento que envolve o estudo e a análise de dados dos mais variados tipos, incluindo financeiros, científicos, sociais e econômicos. Seu intuito é a extração de conhecimento, descoberta de informações ocultas e detecção de padrões em conjuntos de dados para auxiliar na tomada de decisões e gerar valor para o negócio.</p>
<p>Por conta disso,&nbsp;uma das profissões / carreiras mais em alta na atualidade é o cargo de Cientista de Dados.&nbsp;</p>
<p>Um cientista de dados precisa ter um leque de conhecimentos diverso, combinando expertise em várias áreas do conhecimento, como matemática (principalmente estatística e probabilidade), conhecimentos específicos da área do negócio e, naturalmente, linguagens de programação para a criação de algoritmos e aplicações de software que são empregados no dia-a-dia.</p>
<p>E aqui surge a dúvida mais comum entre os aspirantes à ciência de dados: que linguagem de programação aprender? Dada a quantidade de opções existentes, incluindo linguagens de uso geral e linguagens de nicho, quais linguagens de programação seriam mais apropriadas para uso em ciência de dados?</p>
<p>Para ajudar a responder a essas perguntar e dar um direcionamento aos interessados na área, listo a seguir sete linguagens de programação muito importantes e úteis para o trabalho de um cientista de dados atualmente (e para outras áreas, como Big Data, Machine Learning, Inteligência Artificial, e outras).</p>
<p>Vamos lá!</p>
<h3>1. <a href="http://www.bosontreinamentos.com.br/category/programacao-em-python/">Python</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17374" title="linguagem de programação python" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo-1024x1024.png" alt="Logotipo Python" width="250" height="250" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo-1024x1024.png 1024w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo-170x170.png 170w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo-420x420.png 420w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo-768x768.png 768w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Python-logo.png 2000w" sizes="auto, (max-width: 250px) 100vw, 250px" /></p>
<p>Python é, sem sombra de dúvida, a linguagem ideal para iniciantes em ciência de dados e muitas outras áreas da computação). Com Python é possível trabalhar em nichos diversos como aprendizado de máquina, inteligência artificial, análise de dados, visualização de dados, automação de tarefas e como linguagem de propósito geral, tudo graças ao seu extenso conjunto de poderosas bibliotecas, que inclui ferramentas como <a href="http://www.bosontreinamentos.com.br/programacao-em-python/como-criar-um-array-no-python-com-numpy/">NumPy</a>, <a href="http://www.bosontreinamentos.com.br/programacao-em-python/como-criar-graficos-com-matplotlib-em-python/">Matplotlib</a>, Pandas, SciPy e muitas outras.</p>
<p>É, atualmente, uma das linguagens mais utilizadas no mundo, e com perspectivas de crescimento ainda maior nos próximos anos.<br />
Além de tudo isso, é uma linguagem ideal para iniciantes em computação, por sua facilidade de uso e curva de aprendizado muito suave.</p>
<p>É uma linguagem de código aberto, orientada a objetos, muito flexível e com uma comunidade de desenvolvedores gigantesca, que facilita enormemente a troca de informações e orientações sobre ouso da linguagem em si e suas bibliotecas.</p>
<h3>2. <a href="http://www.bosontreinamentos.com.br/category/programacao-em-r/">Linguagem R</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17376" title="linguagem r para ciência de dados" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r.png" alt="Linguagem R" width="251" height="141" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r.png 960w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r-420x236.png 420w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r-768x432.png 768w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r-580x326.png 580w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/logo-linguagem-r-174x98.png 174w" sizes="auto, (max-width: 251px) 100vw, 251px" /></p>
<p>Outra linguagem de peso no mundo da ciência de dados, é uma das ferramentas open source para análise estatística mais poderosas disponívis, e que pode ser empregada em tarefas como processamento de grandes volumes de dados, modelagem matemática, mineração de dados, cálculos estatísticos (claro!), e ainda por cima possui bibliotecas gráficas de alta qualidade para visualização de dados.</p>
<p>Com R é possível criar aplicações como sistemas de detecção de fraudes financeiras, modelagem de análise de sentimentos e sistemas de recomendação, além de aplicações para áreas tão diversas quanto engenharia, medicina e biologia.</p>
<p>Tarefas como análise de séries temporais, clustering e modelagem linear são algumas dos exemplos de processos que a linguagem R suporta com simplicidade.</p>
<p>Além disso, existem várias interfaces que podem ser usadas com o R para facilitar o trabalho de desenvolvimento de algoritmos e aplicações, tais como o RStudio e Jupyter Notebooks, entre outras.</p>
<p>Comumente usamos Python e R combinados, unindo suas funcionalidades em um par excelente para praticamente qualquer aplicação.</p>
<p>Como contras da linguagem, podemos citar a velocidade de execução e a quantidade de recursos de hardware que scripts escritos em R consomem, especialmente memória RAM.</p>
<h3>3. <a href="http://www.bosontreinamentos.com.br/curso-completo-de-mysql/">SQL</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17655" title="bancos de dados com SQL" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2021/03/Database-icon-05.png" alt="linguagem SQL para bancos de dados" width="250" height="250" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2021/03/Database-icon-05.png 400w, https://www.bosontreinamentos.com.br/wp-content/uploads/2021/03/Database-icon-05-170x170.png 170w" sizes="auto, (max-width: 250px) 100vw, 250px" /></p>
<p>Linguagem de Consulta Estruturada para Bancos de Dados, é uma das linguagens mais importantes para trabalho com dados e principalmente <a href="https://youtu.be/JPC5mE9iI0I" target="_blank" rel="noopener">Big Data</a>, ao combinar capacidades analíticas e de consultas com transacionais. SQL é um conhecimento básico para praticamente qualquer interessado em trabalhar com desenvolvimento de sistemas de todos os tipos, e em ciência de dados é imprescindível.</p>
<p>Em que usamos SQL exatamente? Bem, trata-se de uma linguagem de domínio específico, sendo empregada no gerenciamento de dados armazenados, local ou remotamente.</p>
<p>Note que existem diversos &#8220;sabores&#8221; de SQL, dependendo da implementação do fabricante &#8211; mas todos seguem um mesmo padrão, o ANSI SQL. E um ponto muito favorável do SQL é que essa linguagem se integra com muita facilidade às outras linguagens de programação, sendo extremamente comum desenvolver aplicações que mesclem códigos escritos, por exemplo, em Python ou Java com SQL.</p>
<h3>4. <a href="http://www.bosontreinamentos.com.br/category/java/">Java</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17379" title="linguagem java para data science" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/java.png" alt="Linguagem Java da Oracle" width="250" height="250" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/java.png 512w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/java-170x170.png 170w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/java-420x420.png 420w" sizes="auto, (max-width: 250px) 100vw, 250px" /></p>
<p>Linguagem de propósito geral e alta performance, o Java é empregado no desenvolvimento de algoritmos para machine learning, além de encontrar aplicações em nichos como Big Data e IoT (Internet das Coisas). É vastamente empregada no desenvolvimento de aplicações móveis e para Web.</p>
<p>Muitos frameworks e ferramentas empregadas em Big Data são escritos ou rodam em Java, como por exemplo Apache Spark, Hive e o Hadoop.</p>
<p>Uma das grandes vantagens do Java é a disponibilidade de IDEs de qualidade para o desenvolvimento de aplicações com eficiência e rapidez, incluindo softwares de alta complexidade. Alguns dos IDEs mais comuns incluem o Eclipse, Netbeans e IntelliJ, entre outros menos usados.</p>
<p>Alguns dos nichos onde o Java é mais empregado na área de ciência de dados incluem Aprendizado Profundo (Deep Learning), Processamento de Linguagem Natural (NLP &#8211; Natural Language Processing) e Mineração de Dados (Data Mining), entre outras.</p>
<p>Um ponto no qual a linguagem peca é a falta de ferramentas altamente especializadas para trabalho com estatística e cálculos matemáticos avançados, o que pode ser contornado combinando a linguagem Java com outras linguagens mais especializadas como a linguagem R, por exemplo.</p>
<h3>5. <a href="http://www.bosontreinamentos.com.br/category/programacao-em-c/">C/C++</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17381" title="aprender c++ para ciência de dados" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao-1024x1024.png" alt="Linguagem de Programação C++" width="250" height="250" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao-1024x1024.png 1024w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao-170x170.png 170w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao-420x420.png 420w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao-768x768.png 768w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/linguagem-c-programacao.png 1600w" sizes="auto, (max-width: 250px) 100vw, 250px" /></p>
<p>São as linguagens mais antigas listadas neste artigo, e provavelmente as mais difíceis de aprender, mas nem por isso com importância menor: C/C++ (principalmente C++) constitui a principal ferramenta em muitos tipos de sistemas de alta performance, sendo empregada em áreas como Inteligência Artificial, Aprendizado de Máquina e Robótica, onde o processamento de dados analíticos precisa ser feito com muita rapidez e alta performance.</p>
<p>Uma das aplicações mais modernas do C++ é no desenvolvimento de aplicações para veículos autônomos, que necessitam de algoritmos de análise de dados altamente complexos e performáticos, e em muitas aplicações de tempo real onde conjuntos de dados precisam ser tratados praticamente no momento em que são utilizados.</p>
<p>É interessante notar que muitas das linguagens citadas neste artigo são elas próprias escritas em C ou C++, com Python, R e Julia, assim como muitas bibliotecas e frameworks usados em data science, como o TensorFlow, por exemplo.</p>
<h3>6. <a href="http://www.bosontreinamentos.com.br/julia/como-instalar-a-linguagem-julia-no-linux-debian/">Julia</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17236" title="linguagem julia para data science" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/11/julia-logo-1024x692.png" alt="Logo linguagem Julia" width="250" height="169" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/11/julia-logo.png 1024w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/11/julia-logo-420x284.png 420w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/11/julia-logo-768x519.png 768w" sizes="auto, (max-width: 250px) 100vw, 250px" /></p>
<p>Inicialmente concebida como uma linguagem para programação científica, é uma linguagem de alto nível extremamente rápida que pode ser usada para o desenvolvimento de diversos tipos de aplicações, sozinha ou em conjunto com bibliotecas C/C++ ou Python.</p>
<p>Sua grande força está nas tarefas de análise numérica, apesar de também poder ser usada como linguagem de programação de propósito geral. É uma linguagem intuitiva, bastante acessível, além de ser de código aberto.</p>
<p>Uma de suas principais aplicações é na área financeira, onde existe a necessidade de realizar cálculos de forma massiva e com muita rapidez, com cálculos de análise de risco ou análise de séries temporais.</p>
<p>Um de seus problemas é o fato de ser uma linguagem relativamente nova e, que por isso, ainda possui uma comunidade de usuários pequena, com menos documentação disponível para consulta.</p>
<p>Porém, permite o interfaceamento (direto ou por pacotes específicos) com bibliotecas de outras linguagens, como Python, R, C++, Matlab e até mesmo Fortran, a´lem de possuir suporta a computação distribuída e computação paralela, o que significa aplicações de elevada performance!</p>
<p>Suas ferramentas de visualização de dados ainda não estão no mesmo nível das ferramentas disponíveis outras linguagens, mas vem melhorando a cada dia.</p>
<h3>7. Matlab / <a href="http://www.bosontreinamentos.com.br/category/octave/">Octave</a></h3>
<p><img loading="lazy" decoding="async" class="aligncenter wp-image-17432 size-full" title="programação com octave para ciência de dados" src="http://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Gnu-octave.png" alt="GNU Octave - Computação Científica" width="200" height="200" srcset="https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Gnu-octave.png 200w, https://www.bosontreinamentos.com.br/wp-content/uploads/2020/12/Gnu-octave-170x170.png 170w" sizes="auto, (max-width: 200px) 100vw, 200px" /></p>
<p>Matlab é um ambiente de computação matemática e uma linguagem proprietária amplamente utilizada em cenários que demandam operações de cálculos avançados.</p>
<p>Encontra aplicações em análise de dados, processamento de imagens, processamento de sinais e, evidentemente, criação de modelos matemáticos por meio da manipulação de matrizes, álgebra linear, análise numérica e outras técnicas, facilitando enormemente a resolução dos problemas matemáticos mais complicados.</p>
<p>É uma linguagem recomendada para trabalho com Big Data e também na Indústria, principalmente de Engenharia. O Matlab traz suporte nativo a diversos formatos de dados empregados em telemetria, sensores, processamento de imagem e vídeo, e muitos outros.</p>
<p>Como ponto talvez negativo do Matlab posso citar o fato de não ser uma linguagem muito rápida, e necessitar de uma licença, de custo relativamente elevado, para ser usada.</p>
<p>O Octave é a principal alternativa ao Matlab, podendo substitui-la no geral em quase todas as tarefas necessárias para análise de dados, com algumas diferenças funcionais. Além disso, é gratuito.</p>
<h3>Extra: Matemática</h3>
<p>Como citado no início do artigo, conhecimentos em matemática são muito importantes &#8211; até mesmo cruciais &#8211; para o trabalho na área de data science. Alguns dos tópicos mais relevantes em matemática que é necessário dominar &#8211; ou ao menos revisar &#8211; incluem:</p>
<ul>
<li><a href="http://www.bosontreinamentos.com.br/matematica/topicos-em-matematica-media-mediana-e-moda-estatistica/">Estatística</a> (essencial)</li>
<li>Probabilidade&nbsp;(essencial)</li>
<li>Cálculo Integral e Diferencial</li>
<li>Cálculo Numérico (Álgebra Linear)</li>
</ul>
<p>Entre outros. Claro que conhecer matemática é benéfico para qualquer área de atuação, principalmente nos domínios da tecnologia, independente do trabalho ser voltado para ciência de dados ou não.</p>
<p>Além disso, tão importante quanto conhecer as linguagens de programação é saber como usar as diversas bibliotecas e frameworks disponíveis para data science, pois, no dia-a-dia do trabalho, é o que você irá usar com mais frequência, e por isso vale a pena investir seu tempo nesse aprendizado.</p>
<h3>Conclusão</h3>
<p>Neste artigo procurei trazer algumas das linguagens de programação mais indicadas para quem deseja trabalhar com ciência de dados. Note que essas sete linguagens não são as únicas que se prestam a essa tarefa, existindo outras linguagens também interessantes para a área, como Haskell e Lisp, por exemplo. Ciência de Dados é uma área muito vasta, se ramificando em inúmeros caminhos possíveis, e a verdade é que provavelmente você precisará aprender mais do que uma das linguagens citadas &#8211; talvez várias delas ao longo de sua carreira e estudos.</p>
<p>Finalmente, tudo o que foi exposto aqui é, basicamente, minha opinião pessoal e minha visão, baseada em meus estudos e experiência de mercado e acadêmica.</p>
<p>Evidentemente vocês podem pensar de forma diferente &#8211; talvez achando que uma linguagem deveria ter sido incluída na lista, ou que uma das linguagens que citei não deveria estar aqui &#8211; e por isso os convido a postarem seus pensamentos nos comentários logo abaixo, para trocarmos ideias sobre esse assunto tão importante e interessante na atualidade &#8211; e certamente pelos anos vindouros.</p>
<p>Até!</p>
<p>&nbsp;</p>
<p>O post <a href="https://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/">7 Linguagens de programação para Ciência de Dados &#8211; 2021</a> apareceu primeiro em <a href="https://www.bosontreinamentos.com.br">Bóson Treinamentos em Ciência e Tecnologia</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.bosontreinamentos.com.br/ciencia-de-dados/7-linguagens-de-programacao-para-ciencia-de-dados-2021/feed/</wfw:commentRss>
			<slash:comments>2</slash:comments>
		
		
			</item>
	</channel>
</rss>
