2015-12-29 92 views
5

我正在使用rvest。我想結果轉換爲數據幀:將xml_nodeset轉換爲data.frame

> links <- pgsession %>% jump_to(urls[2]) %>% read_html() %>% html_nodes("a")  
> links 
{xml_nodeset (114)} 
[1] <a href="/Mitglieder/Detail/1213412">Date</a> 
[2] <a href="/Account/ChangePassword">Kennwort ändern</a> 
[3] <a href="/Account/BenutzernamenAendern/124312234">Benutzernamen ändern</a> 
[4] <a href="/Account/LogOff">Abmelden</a> 
...  

我用下面的方法:

library(plyr) 
ldply(xmlToList(links), data.frame) 
Error in UseMethod("xmlSApply") : 
    no applicable method for 'xmlSApply' applied to an object of class "xml_nodeset" 
df1 <- data.frame(character(13000)) 
df1 <- rbind(df1, data.frame(links))# append to data.frame 

但是,我得到一個錯誤:

Error in UseMethod("xmlSApply") : 
    no applicable method for 'xmlSApply' applied to an object of class "xml_nodeset" 

任何建議什麼我做錯了?

我很感謝你的回覆!

+2

'data.frame(hrefs = as(links,「character」))''? – lukeA

回答

9

這會讓你把鏈接中的所有屬性變成tbl_dfbind_rows讓你「補」免費:

library(rvest) 
library(dplyr) 

pg <- read_html("https://en.wikipedia.org/wiki/Main_Page") 
links <- html_nodes(pg, "a") 
bind_rows(lapply(xml_attrs(links), function(x) data.frame(as.list(x), stringsAsFactors=FALSE))) 

## Source: local data frame [310 x 10] 
## 
##  id       href     title class dir accesskey rel lang hreflang style 
## (chr)      (chr)     (chr) (chr) (chr)  (chr) (chr) (chr) (chr) (chr) 
## 1 top       NA      NA NA NA  NA NA NA  NA NA 
## 2  NA      #mw-head      NA NA NA  NA NA NA  NA NA 
## 3  NA     #p-search      NA NA NA  NA NA NA  NA NA 
## 4  NA    /wiki/Wikipedia    Wikipedia NA NA  NA NA NA  NA NA 
## 5  NA   /wiki/Free_content   Free content NA NA  NA NA NA  NA NA 
## 6  NA   /wiki/Encyclopedia   Encyclopedia NA NA  NA NA NA  NA NA 
## 7  NA /wiki/Wikipedia:Introduction Wikipedia:Introduction NA NA  NA NA NA  NA NA 
## 8  NA  /wiki/Special:Statistics  Special:Statistics NA NA  NA NA NA  NA NA 
## 9  NA  /wiki/English_language  English language NA NA  NA NA NA  NA NA 
## 10 NA   /wiki/Portal:Arts   Portal:Arts NA NA  NA NA NA  NA NA 
## .. ...       ...     ... ... ...  ... ... ...  ... ... 

或者,你可以使用purrr

library(rvest) 
library(purrr) 

pg <- read_html("https://en.wikipedia.org/wiki/Main_Page") 
html_nodes(pg, "a") %>% 
    map(xml_attrs) %>% 
    map_df(~as.list(.)) 

## # A tibble: 342 × 10 
##  id       href     title class dir accesskey rel hreflang lang style 
## <chr>      <chr>     <chr> <chr> <chr>  <chr> <chr> <chr> <chr> <chr> 
## 1 top       <NA>     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 2 <NA>      #mw-head     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 3 <NA>     #p-search     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 4 <NA>    /wiki/Wikipedia    Wikipedia <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 5 <NA>   /wiki/Free_content   Free content <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 6 <NA>   /wiki/Encyclopedia   Encyclopedia <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 7 <NA> /wiki/Wikipedia:Introduction Wikipedia:Introduction <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 8 <NA>  /wiki/Special:Statistics  Special:Statistics <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 9 <NA>  /wiki/English_language  English language <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 10 <NA>   /wiki/Portal:Arts   Portal:Arts <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## # ... with 332 more rows 

我認爲是比較地道的功能和整體更簡潔的方法。

+0

我的用例是,我有更多的頁面有相同的結果,並希望將它們添加到數據框中。我怎樣才能同樣使用'bind_rows'? – mrquad

+0

'bind_rows'也會「填充」那些。 – hrbrmstr

相關問題