Inicio › Foros › Etapa III – Ciencia de Datos › Bloque 3-Descubre tu tabla de datos
Etiquetado: Transformaciones
- Este debate tiene 4 respuestas, 3 mensajes y ha sido actualizado por última vez el hace 5 años, 1 mes por
Jordi.
-
AutorEntradas
-
2 febrero, 2021 a las 12:17 #10468
José Alejandro Erazo VillegasParticipanteEstimados compañeros y estimado Jordi
Estoy viendo el video de las transformaciones más típicas en la práctica de la etapa 3, y tengo una duda muy grande.
Cuando se usa la función scale y no se quiere centrar y solo escalar, se usa: scale(x,center=FALSE,scale=TRUE), pero la función usa otra desviación estándar y no la de la columna elegida.
Para ilustrar mi ejemplo utilice el siguiente código:datos <- matrix(1:5, ncol = 1)
prueba <- t(data.frame(mean= apply(datos,2,mean),
sd = apply(datos, 2, sd)))
#Estandarizacion
df <- scale(datos[,1], center = TRUE, scale = TRUE)
datos <- cbind(datos,df)
#Centrado
df <- scale(datos[,1], center = TRUE, scale = FALSE)
datos <- cbind(datos,df)
#Escalando sin centrar
df <- scale(datos[,1], center = FALSE, scale = TRUE)
datos <- cbind(datos,df)
#Escalando sin centrar (usando la sd de la columna)
df <- scale(datos[,1], center = FALSE, scale = prueba[2,1])
datos <- cbind(datos,df)En el caso de escalado sin centrar, la función usa una desviación de 3,7 siendo la desviación de esta columna 1,58. Por eso forcé una cuarta opción para usar la desviación que le corresponde.
Saben por que pasa esto? Favor su ayuda y cooperación.8 marzo, 2021 a las 9:13 #10694
JordiSuperadministradorPerdona no haber respondido en la etapa 3. Es fallo mío. No me llegó el aviso.
Te contesto en vídeo:
Y el código que he generado en el vídeo:
x <- rnorm(100,10,2) sd(x) mean(x) #Estandarizado zX <- scale(x,center=TRUE, scale=TRUE) mean(zX) sd(zX) #Quitar la media zX1 <- scale(x,center=TRUE, scale=FALSE) mean(zX1) sd(zX1) #Escalado sin centrar zX2 <- scale(x,center=FALSE, scale=TRUE) mean(zX2) sd(zX2)
8 marzo, 2021 a las 10:11 #10700
JordiSuperadministradorHola!
Este sería el código ejemplo para escalar sin centrar:
x <- rnorm(100,10,2) x/sd(x) mean(x/sd(x)) sd(x/sd(x))
19 julio, 2021 a las 11:22 #11710
Antonio JusticiaParticipanteHola podrías explicar para que se utiliza con un ejemplo ¿?
Gracias y un saludo.22 julio, 2021 a las 9:25 #11735
JordiSuperadministradorEl estandarizado se utiliza por ejemplo en los problemas de clustering.
El clustering es muy sensible a la unidades, es decir, una variable en miles de euros tendrá más peso que otra variable que significa el número de ventas. Para ello se estandariza para que todas las variables estén en una misma escala y solo tengas en cuenta la dispersiones entre puntos.
Espero haberme explicado 🙂
-
AutorEntradas
- Debes estar registrado para responder a este debate.