Modelos lineares generalizados Veja ajuda (glm) para outras opções de modelagem. Veja a ajuda (família) para outras funções de link permitidas para cada família. Três subtipos de modelos lineares generalizados serão abordados aqui: regressão logística, regressão de poisson e análise de sobrevivência. Regressão logística A regressão logística é útil quando você está predizendo um resultado binário a partir de um conjunto de variáveis preditoras contínuas. É freqüentemente preferido sobre a análise de função discriminante por causa de suas suposições menos restritivas. Regressão logística onde F é um fator binário e x1-x3 são preditores contínuos ajustados lt-glm (Fx1x2x3, datamydata, familybinomial ()) resumo (ajuste) resultados de exibição confint (ajuste) 95 IC para os coeficientes exp (coef (fit) ) Coeficientes exponenciados exp (confint (ajuste)) 95 IC para coeficientes exponenciais predizer (ajuste, tipoquotresponsequot) valores preditos residuals (ajuste, tipoquotdeviancequot) resíduos x, dados mydata) exibirá o gráfico de densidade condicional do resultado binário F no x contínuo variável. Regressão de Poisson A regressão de Poisson é útil para predizer uma variável de desfecho representando contagens de um conjunto de variáveis preditoras contínuas. Poisson Regressão onde contagem é uma contagem e x1-x3 são preditores contínuos que se encaixam lt - glm (contagem x1x2x3, datamydata, familypoisson ()) resumo (ajuste) exibir resultados Se você tem overdispersion (veja se o desvio residual é muito maior do que graus de liberdade ), Você pode querer usar quasipoisson () em vez de poisson (). Análise de sobrevivência A análise de sobrevivência (também chamada análise de histórico de eventos ou análise de confiabilidade) abrange um conjunto de técnicas para modelar o tempo de um evento. Os dados podem ser censurados corretamente - o evento pode não ter ocorrido até o final do estudo ou podemos ter informações incompletas sobre uma observação, mas sabemos que até certo tempo o evento não tinha ocorrido (por exemplo, o participante deixou de estudar na semana 10, mas estava vivo naquela época). Enquanto os modelos lineares generalizados são tipicamente analisados usando a função glm (), a análise de sobrevivência é tipicamente realizada usando funções do pacote de sobrevivência. O pacote de sobrevivência pode lidar com um e dois problemas de amostra, modelos paramétricos de falha acelerada e o modelo de riscos proporcionais de Cox. Normalmente, os dados são inseridos na hora de início do formato. pare o tempo . E status (1evento ocorreu, 0evento não ocorreu). Alternativamente, os dados podem estar no formato de tempo para evento e status (1event ocorreu, 0event não ocorreu). Um status0 indica que a observação é correta. Os dados são empacotados em um objeto Surv através da função Surv () antes de outras análises. Sobrevivência () é usado para estimar uma distribuição de sobrevivência para um ou mais grupos. Survdiff () testes para diferenças nas distribuições de sobrevivência entre dois ou mais grupos. Coxph () modela a função hazard em um conjunto de variáveis preditoras. Mayo Clinic Câncer de pulmão Biblioteca de dados (sobrevivência) aprender sobre o conjunto de dados ajuda (pulmão) criar um Surv objeto sobreviver lt - com (pulmão, Surv (tempo, estado)) Plot sobrevivência distribuição da amostra total Kaplan-Meier estimador fit0 lt - (Survobj 1, datalung) resumo (fit0) parcela (fit0, xlabquotSurvival Tempo em Daysquot, ylabquot Survivingquot, yscale100, mainquotSurvival Distribution (Overall) quot) Compare as distribuições de sobrevivência de homens e mulheres fit1 lt - survit (Quottoprightquot, titlequotGenderquot, c (quotMalequot, quotbluequot), fillc (quotredquot, quotbluequot)) teste de diferença (fit1, xlabquotSurvival Time em Daysquot, ylabquot Survivingquot, yscale100, colc (quotredquot, quotbluequot), mainquotSurvival Distributions by Genderquot) Entre as curvas de sobrevivência masculina e feminina (teste logarítmico) sobrevivência (sobrevivência) predizem a sobrevivência masculina a partir da idade e pontuações médicas MaleMod lt-coxph (survobj ageph. ecogph. karnopat. karno, datalung, subsetsex1) exibir resultados MaleMod avaliar a hipótese de riscos proporcionais cox. zph (MaleMod) Veja artigo de notícia de Thomas Lumleys R no pacote da sobrevivência para mais informação. Outras boas fontes incluem Mai Zhous Use R Software para fazer Análise de Sobrevivência e Simulação e M. J. Crawleys capítulo sobre Análise de Sobrevivência. O método a ser usado na montagem do modelo. O método padrão glm. fit usa iterativamente os mínimos quadrados reponderados (IWLS): o modelo alternativo. frame retorna a moldura do modelo e não encaixa. Funções de encaixe fornecidas pelo usuário podem ser fornecidas como uma função ou uma seqüência de caracteres nomeando uma função, com uma função que tem os mesmos argumentos que glm. fit. Se especificado como uma seqüência de caracteres, ele é pesquisado a partir do namespace stats. Para glm. Valores lógicos que indicam se o vetor de resposta ea matriz de modelo utilizados no processo de ajuste devem ser retornados como componentes do valor retornado. Para glm. fit. X é uma matriz de projeto de dimensão n p. E y é um vetor de observações de comprimento n. Uma lista opcional. Veja os contrastes. arg de model. matrix. default. Para glm. Argumentos a serem usados para formar o argumento de controle padrão se ele não for fornecido diretamente. Para pesos. Outros argumentos passados para ou de outros métodos. Um preditor típico tem os termos de resposta de formulário onde resposta é o vetor de resposta (numérico) e termos é uma série de termos que especifica um preditor linear para resposta. Para as famílias binomial e quasibinomial, a resposta também pode ser especificada como um fator (quando o primeiro nível denota falha e todos os demais sucesso) ou como uma matriz de duas colunas com as colunas que dão o número de sucessos e falhas. Uma especificação de termos do segundo formulário primeiro indica todos os termos em primeiro juntamente com todos os termos em segundo com quaisquer duplicados removidos. Uma especificação do formulário primeiro: segundo indica o conjunto de termos obtidos tomando as interações de todos os termos em primeiro com todos os termos em segundo. A primeira especificação indica o cruzamento de primeiro e segundo. Este é o mesmo que primeiro segundo primeiro: segundo. Os termos da fórmula serão reordenados para que os efeitos principais venham primeiro, seguidos pelas interações, todas as de segunda ordem, todas de terceira ordem e assim por diante: para evitar isso, passe um objeto de termos como a fórmula. Pesos não-NULL podem ser usados para indicar que diferentes observações têm dispersões diferentes (com os valores em pesos sendo inversamente proporcionais às dispersões) ou equivalentemente, quando os elementos de pesos são inteiros positivos wi. Que cada resposta yi é a média de wi observações de peso unitário. Para um GLM binomial pesos anteriores são usados para dar o número de testes quando a resposta é a proporção de sucessos: eles seriam raramente usados para um GLM de Poisson. Glm. fit é a função workhorse: não é normalmente chamado diretamente, mas pode ser mais eficiente onde o vetor de resposta, matriz de projeto e família já foram calculados. Se mais de um de etastart. Start e mustart for especificado, o primeiro na lista será usado. Muitas vezes é aconselhável fornecer valores iniciais para uma família quase, e também para famílias com links incomuns, como gaussiano (log). Todos os pesos. Subconjunto Deslocamento. Etastart e mustart são avaliados da mesma forma que as variáveis na fórmula. Que é o primeiro em dados e depois no ambiente de fórmula. Para o fundo das mensagens de aviso sobre probabilidades lsquofitted numericamente 0 ou 1 ocorreu para binomial GLMs, ver Venables amp Ripley (2002, pp. 197ndash8). Glm retorna um objeto de classe herdando de glm que herda da classe lm. Veja mais adiante nesta seção. Se for utilizado um método não padrão, o objeto também herdará da classe (se houver) retornada por essa função. O resumo de função (isto é, summary. glm) pode ser usado para obter ou imprimir um resumo dos resultados e a função anova (isto é, anova. glm) para produzir uma tabela de análise de variância. O acessador genérico funciona coeficientes. Efeitos. Os valores ajustados e os resíduos podem ser utilizados para extrair várias características úteis do valor retornado por glm. Pesos extrai um vetor de pesos, um para cada caso no ajuste (após subconjunto e na. action). Um objeto da classe glm é uma lista contendo pelo menos os seguintes componentes: até uma constante, menos o dobro da log-verossimilhança maximizada. Onde sensível, a constante é escolhida de modo que um modelo saturado tenha desvio zero. Uma versão do Akaikes Um critério de informação. Menos duas vezes a log-verossimilhança maximizada mais o dobro do número de parâmetros, calculada pela componente aic da família. Para as famílias binomial e veneno, a dispersão é fixada em um eo número de parâmetros é o número de coeficientes. Para as famílias gaussiana, Gamma e gaussiana inversa, a dispersão é estimada a partir do desvio residual eo número de parâmetros é o número de coeficientes mais um. Para uma família gaussiana, a MLE da dispersão é usada por isso é um valor válido de AIC, mas para Gamma e famílias gaussianas inversas não é. Para as famílias ajustadas por quase-verossimilhança o valor é NA. O desvio para o modelo nulo, comparável com o desvio. O modelo nulo incluirá o deslocamento e uma intercepção se houver um no modelo. Observe que isso será incorreto se a função de link depender dos dados além da média ajustada: especifique um deslocamento de zero para forçar um cálculo correto. O número de iterações de IWLS usado. (Quando relevante) informações retornadas por model. frame sobre o tratamento especial de NA s. Além disso, ajustes não vazios terão componentes qr. R e efeitos relativos ao ajuste linear ponderado final. Os objetos da classe glm são normalmente de classe c (glm, lm). Que é herdado da classe lm. E métodos bem projetados para a classe lm serão aplicados ao modelo linear ponderado na iteração final de IWLS. No entanto, cuidado é necessário, como funções de extrator para classe glm, como resíduos e pesos não apenas escolher o componente do ajuste com o mesmo nome. Se um modelo glm binomial foi especificado dando uma resposta de duas colunas, os pesos retornados por pesos anteriores são o número total de casos (fatorado pelos pesos de caso fornecidos) ea componente y do resultado é a proporção de sucessos. Funções de montagem O método de argumento tem dois propósitos. Uma delas é permitir que a moldura do modelo seja recriada sem encaixe. O outro é permitir que a função de ajuste padrão glm. fit seja substituída por uma função que usa os mesmos argumentos e usa um algoritmo de ajuste diferente. Se glm. fit é fornecido como uma seqüência de caracteres é usado para procurar uma função desse nome, começando no namespace stats. A classe do retorno do objeto pelo instalador (se houver) será precedida da classe retornada por glm. A implementação original de R de glm foi escrita por Simon Davies trabalhando para Ross Ihaka na Universidade de Auckland, mas desde então tem sido amplamente re-escrito por membros da equipe R Core. O design foi inspirado pela função S do mesmo nome descrita em Hastie amp Pregibon (1992). Referências Dobson, A. J. (1990) Uma Introdução aos Modelos Lineares Generalizados. Londres: Chapman e Hall. Hastie, T. J. e Pregibon, D. (1992) Modelos lineares generalizados. O Capítulo 6 de Modelos Estatísticos em S eds J. M. Chambers e T. J. Hastie, Wadsworth amp Brooks / Cole. McCullagh P. e Nelder, J. A. (1989) Modelos lineares generalizados. Londres: Chapman e Hall. Venables, W. N. e Ripley, B. D. (2002) Modern Applied Statistics com S. New York: Springer. Lm para modelos lineares não-generalizados (que SAS chama GLMs, para modelos lineares lsquogeneralrsquo). Loglin e loglm (pacote MASS) para montagem de modelos log-lineares (que binomial e Poisson GLMs são) para tabelas de contingência. Bigglm no pacote biglm para uma maneira alternativa de ajustar GLMs a grandes conjuntos de dados (especialmente aqueles com muitos casos). Modelos Lineares Generalizados em R, Parte 3: Traçando Probabilidades Previsíveis por David Lillis, Ph. D. Em nosso último artigo, aprendemos sobre o ajuste de modelo em Modelos Lineares Generalizados em dados binários usando o comando glm (). Continuamos com o mesmo glm no conjunto de dados mtcars (regressão da variável vs sobre o peso e deslocamento do motor). Agora queremos traçar o nosso modelo, juntamente com os dados observados. Embora tenhamos executado um modelo com múltiplos preditores, ele pode ajudar a interpretação para traçar a probabilidade predita que vs 1 contra cada preditor separadamente. Então, primeiro nós encaixamos um glm para apenas um dos nossos preditores, wt. Para traçar o nosso modelo precisamos de uma gama de valores de peso para os quais produzir valores ajustados. Esta gama de valores que podemos estabelecer a partir da gama real de valores de wt. Uma gama de valores de peso entre 0 e 6 seria ideal. Assim, criamos uma seqüência de valores entre 0 e 6 em incrementos de 0,01. Juntar um número tão grande de pontos estreitamente espaçados dará uma aparência suave ao nosso modelo. Agora usamos a função predict () para criar o modelo para todos os valores de xweight. Podemos fazer o mesmo para o deslocamento. Podemos ver que, para ambos os preditores, há uma relação negativa entre a probabilidade de que 1 e a variável preditora. À medida que o preditor aumenta, a probabilidade diminui. Isso não era tão difícil No nosso próximo artigo, vamos olhar para outras aplicações da função glm (). Sobre o autor: David Lillis ensinou R a muitos pesquisadores e estatísticos. Sua empresa, Sigma Statistics and Research Limited. Fornece instrução on-line e oficinas presenciais em R, e serviços de codificação em R. David é doutorado em estatística aplicada. Quer aprender a função de GLS de Rs Nesta oficina de seis horas. Você aprenderá a usar glm () para especificar regressões probit logísticas, regressões binomiais negativas de poisson e regressões gama ... e incluir as opções específicas para cada uma delas. Eu usei glm com erro quasibinomial para olhar o efeito da produtividade e da densidade inicial na proporção de emigração de insetos. A produtividade não teve qualquer efeito e cheguei ao seguinte modelo final: Model5glm (y NFNF2, quasibinomial) Preciso usar este modelo para ajustar uma curva ao meu gráfico de dispersão para mostrar o efeito quadrático da densidade inicial na proporção emigrante. O que eu li foi usar os coeficientes da tabela de resumo deste modelo para fazer a linha: Coeficientes: Estimar Std. Erro t valor Pr (gtt) (Intercept) 1,47047 0,89089 1,651 0,1104 NF -0,87076 0,41867 -2,080 0,0472 NF2 0,06405 0,03056 2,096 0,0456 Eu olhei para este exemplo que você forneceu em sua página e eu queria saber como você pode plotar curva em scatter plot quando você Ter efeito quadrático da mesma variável (no meu caso NF2) Quando eu tento seguir o que você fez para o seu exemplo eu continuo recebendo o seguinte erro: x ylt - predict (modelo5, list (NFx), typequotresponsequot) Erro em model. frame. default (terms, newdata, na. action na. action, xlev objectxlevels): os comprimentos variáveis diferem (encontrados para 039NF2039) Quando eu uso os coeficientes e faço esta equação ProEmig1.470466- 0.870759NF0.064054NF2 não cabe nos meus dados corretamente. NFLt-seq (0, 12, by0.1) linhas (NF, 1.470466- 0.870759NF 0.064054NF2) parcela (NF, ProEmig, mainquotPolynomial Modelquot, xlabquotNFquot, ylabquotProEmigquot) Eu li algo sobre volta transformar os coeficientes, mas não tenho certeza se A razão que eu não estou recebendo a linha correta é porque eu preciso para a transformação e se sim como vou fazer que estou realmente confuso para fazer a linha e eu aprecio qualquer ajuda e sugestão. Obrigado. Yhanks para o seu apoio eu preciso de uma solução: Se eu quiser considerar duas variabiles no meu modelo, como posso fazer o enredo eu tenho dipendent. Preditores de felicidade. amigos. renda
No comments:
Post a Comment