#Clear existing data and graphics
rm(list=ls())
graphics.off()

#Read Data

data=read.csv('RepeAT05_DATA_2016-11-01_3.csv')
#Setting Labels


label(data$record_id)="Record ID"
label(data$article_doi)="Article DOI"
label(data$journal_publication)="Journal of Publication"
label(data$publication_date)="Publication Date"
label(data$publication_issue)="Is the publication submitted as part of a special issue or editorial? If yes, please list the issue title."
label(data$author_fn)="Corresponding Author First Name"
label(data$author_ln)="Corresponding Author Last Name"
label(data$author_email)="Corresponding Author Email"
label(data$article_title)="Article Title"
label(data$institution_corr_author)="Institution of Corresponding Author"
label(data$research_center)="Authors Affiliated Research Center"
label(data$clinical_domain)="Clinical Domain Category"
label(data$primary_research)="Is the publication presenting primary research wherein new data is collected and/or secondary data is reused towards a new purpose?"
label(data$meta_analysis)="Is the publication presenting a meta-analysis?"
label(data$reproducibilityresearch_yn)="Is the publication presenting an attempt at reproducing research?"
label(data$hypothesis_gen_or_driv)="Is the research hypothesis-driven or hypothesis-generating?"
label(data$clear_hypothesis)="Publication states null and alternative hypothesis?"
label(data$reviewer)="Reviewer name"
label(data$funders)="Project funders"
label(data$grant_ids)="Grant identifiers"
label(data$publication_overview_and_bibliographic_information_complete)="Complete?"
label(data$state_data_sources)="Publication states database(s) source(s) of data?"
label(data$state_database_where___1)="Publication states database(s) source(s) of data in the following location: (choice=Not Stated)"
label(data$state_database_where___2)="Publication states database(s) source(s) of data in the following location: (choice=Supplementary materials)"
label(data$state_database_where___3)="Publication states database(s) source(s) of data in the following location: (choice=Appendix)"
label(data$state_database_where___4)="Publication states database(s) source(s) of data in the following location: (choice=Body of text)"
label(data$database_cited)="Does the publication include database citation(s)?"
label(data$query_script_shared)="Does the researcher share a query script for databases used throughout the data collection workflow?"
label(data$query_method_stated)="Do the authors state the methods used for collecting data?"
label(data$query_method_location___2)="States query methodology in the following location: (choice=Supplementary materials (query script or metadata))"
label(data$query_method_location___3)="States query methodology in the following location: (choice=Appendix)"
label(data$query_method_location___4)="States query methodology in the following location: (choice=Body of text)"
label(data$db_citation_1)="Database Name 1"
label(data$db_doi_1)="Database 1 DOI"
label(data$query_method_db_1___2)="Query methodology for Database 1 (choice=Manual extraction)"
label(data$query_method_db_1___3)="Query methodology for Database 1 (choice=Digital extraction through query interface)"
label(data$query_method_db_1___4)="Query methodology for Database 1 (choice=Digital extraction through honest broker (with and/or without shared SQL/data extraction scripts))"
label(data$query_method_db_1___5)="Query methodology for Database 1 (choice=Not Applicable/Not Stated)"
label(data$query_script_loc_db_1___1)="In which of the following does the researcher share a query script for Database 1: (choice=Affiliated Research Center Website)"
label(data$query_script_loc_db_1___2)="In which of the following does the researcher share a query script for Database 1: (choice=Authors Institution or Departmental Website)"
label(data$query_script_loc_db_1___3)="In which of the following does the researcher share a query script for Database 1: (choice=Data Registry)"
label(data$query_script_loc_db_1___4)="In which of the following does the researcher share a query script for Database 1: (choice=Journal or Publications Website)"
label(data$query_script_loc_db_1___5)="In which of the following does the researcher share a query script for Database 1: (choice=GitHub)"
label(data$query_script_loc_db_1___6)="In which of the following does the researcher share a query script for Database 1: (choice=Dataset Metadata)"
label(data$query_script_loc_db_1___7)="In which of the following does the researcher share a query script for Database 1: (choice=Readme file)"
label(data$query_script_loc_db_1___8)="In which of the following does the researcher share a query script for Database 1: (choice=Supplementary Materials)"
label(data$query_script_loc_db_1___9)="In which of the following does the researcher share a query script for Database 1: (choice=Appendix)"
label(data$query_script_loc_db_1___10)="In which of the following does the researcher share a query script for Database 1: (choice=Body of Text)"
label(data$query_script_loc_db_1___11)="In which of the following does the researcher share a query script for Database 1: (choice=Not Stated)"
label(data$query_format_db_1)="In what format are query documentation files shared for Database 1?"
label(data$query_script_comments_1)="Does the shared query script for database 1 contain comments and/or notations for ease of reproducibility?"
label(data$query_doc_open_db_1)="Are query resources used throughout data collection proprietary or non-proprietary for database 1?"
label(data$db_metadata_1)="Does the author share the dataset metadata for database 1?"
label(data$restriction_db_1)="Level of restriction for access to database 1"
label(data$db_charge_1)="Must one pay for access to database 1?"
label(data$db_citation_2)="Database Name 2"
label(data$db_doi_2)="Database 2 DOI"
label(data$query_method_db_2___1)="Query methodology for database 2 (choice=Manual extraction)"
label(data$query_method_db_2___2)="Query methodology for database 2 (choice=Digital extraction through query interface)"
label(data$query_method_db_2___3)="Query methodology for database 2 (choice=Digital extraction through honest broker (with and/or without shared SQL/data extraction scripts))"
label(data$query_method_db_2___4)="Query methodology for database 2 (choice=Not Applicable/Unclear due to not stating query method)"
label(data$query_script_loc_db_2___1)="In which of the following does the researcher share a query script for Database 2: (choice=Affiliated Research Center Website)"
label(data$query_script_loc_db_2___2)="In which of the following does the researcher share a query script for Database 2: (choice=Authors Institution or Departmental Website)"
label(data$query_script_loc_db_2___3)="In which of the following does the researcher share a query script for Database 2: (choice=Data Registry)"
label(data$query_script_loc_db_2___4)="In which of the following does the researcher share a query script for Database 2: (choice=Journal or Publications Website)"
label(data$query_script_loc_db_2___5)="In which of the following does the researcher share a query script for Database 2: (choice=GitHub)"
label(data$query_script_loc_db_2___6)="In which of the following does the researcher share a query script for Database 2: (choice=Dataset Metadata)"
label(data$query_script_loc_db_2___7)="In which of the following does the researcher share a query script for Database 2: (choice=Readme file)"
label(data$query_script_loc_db_2___8)="In which of the following does the researcher share a query script for Database 2: (choice=Supplementary Materials)"
label(data$query_script_loc_db_2___9)="In which of the following does the researcher share a query script for Database 2: (choice=Appendix)"
label(data$query_script_loc_db_2___10)="In which of the following does the researcher share a query script for Database 2: (choice=Body of Text)"
label(data$query_script_loc_db_2___11)="In which of the following does the researcher share a query script for Database 2: (choice=Not Stated)"
label(data$query_format_db_2)="In what format are query documentation files shared for database 2?"
label(data$query_script_comments_2)="Does the shared query script for database 2 contain comments and/or notations for ease of reproducibility?"
label(data$query_doc_open_db_2)="Are query resources used throughout data collection proprietary or non-proprietary for database 2?"
label(data$db_metadata_2)="Does the author share the dataset metadata for database 2?"
label(data$db_2_restriction)="Level of restriction for access to database 2"
label(data$db_charge_2)="Must one pay for access to database 2?"
label(data$db_citation_3)="Database Name 3"
label(data$db_doi_3)="Database 3 DOI"
label(data$query_method_3___1)="Query methodology for database 3 (choice=Manual extraction)"
label(data$query_method_3___2)="Query methodology for database 3 (choice=Digital extraction through query interface)"
label(data$query_method_3___3)="Query methodology for database 3 (choice=Digital extraction through honest broker (with and/or without shared SQL/data extraction scripts))"
label(data$query_method_3___4)="Query methodology for database 3 (choice=Not Applicable/Unclear due to not stating query method)"
label(data$query_script_loc_db_3___1)="In which of the following does the researcher share a query script for Database 3: (choice=Affiliated Research Center Website)"
label(data$query_script_loc_db_3___2)="In which of the following does the researcher share a query script for Database 3: (choice=Authors Institution or Departmental Website)"
label(data$query_script_loc_db_3___3)="In which of the following does the researcher share a query script for Database 3: (choice=Data Registry)"
label(data$query_script_loc_db_3___4)="In which of the following does the researcher share a query script for Database 3: (choice=Journal or Publications Website)"
label(data$query_script_loc_db_3___5)="In which of the following does the researcher share a query script for Database 3: (choice=GitHub)"
label(data$query_script_loc_db_3___6)="In which of the following does the researcher share a query script for Database 3: (choice=Dataset Metadata)"
label(data$query_script_loc_db_3___7)="In which of the following does the researcher share a query script for Database 3: (choice=Readme file)"
label(data$query_script_loc_db_3___8)="In which of the following does the researcher share a query script for Database 3: (choice=Supplementary Materials)"
label(data$query_script_loc_db_3___9)="In which of the following does the researcher share a query script for Database 3: (choice=Appendix)"
label(data$query_script_loc_db_3___10)="In which of the following does the researcher share a query script for Database 3: (choice=Body of Text)"
label(data$query_script_loc_db_3___11)="In which of the following does the researcher share a query script for Database 3: (choice=Not Stated)"
label(data$query_format_db_3)="In what format are query documentation files shared for database 3?"
label(data$query_script_comments_3)="Does the shared query script for database 3 contain comments and/or notations for ease of reproducibility?"
label(data$query_doc_open_db_3)="Are query resources used throughout data collection proprietary or non-proprietary for database 3?"
label(data$db_metadata_3)="Does the author share the dataset metadata for database 3?"
label(data$db_3_restriction)="Level of restriction for access to database 3"
label(data$db_charge_3)="Must one pay for access to database 3?"
label(data$db_citation_4)="Database Name 4"
label(data$db_doi_4)="Database 4 DOI"
label(data$query_method_4___1)="Query methodology for database 4 (choice=Manual extraction)"
label(data$query_method_4___2)="Query methodology for database 4 (choice=Digital extraction through query interface)"
label(data$query_method_4___3)="Query methodology for database 4 (choice=Digital extraction through honest broker (with and/or without shared SQL/data extraction scripts))"
label(data$query_method_4___4)="Query methodology for database 4 (choice=Not Applicable/Unclear due to not stating query method)"
label(data$query_script_loc_db_4___1)="In which of the following does the researcher share a query script for Database 4: (choice=Affiliated Research Center Website)"
label(data$query_script_loc_db_4___2)="In which of the following does the researcher share a query script for Database 4: (choice=Authors Institution or Departmental Website)"
label(data$query_script_loc_db_4___3)="In which of the following does the researcher share a query script for Database 4: (choice=Data Registry)"
label(data$query_script_loc_db_4___4)="In which of the following does the researcher share a query script for Database 4: (choice=Journal or Publications Website)"
label(data$query_script_loc_db_4___5)="In which of the following does the researcher share a query script for Database 4: (choice=GitHub)"
label(data$query_script_loc_db_4___6)="In which of the following does the researcher share a query script for Database 4: (choice=Dataset Metadata)"
label(data$query_script_loc_db_4___7)="In which of the following does the researcher share a query script for Database 4: (choice=Readme file)"
label(data$query_script_loc_db_4___8)="In which of the following does the researcher share a query script for Database 4: (choice=Supplementary Materials)"
label(data$query_script_loc_db_4___9)="In which of the following does the researcher share a query script for Database 4: (choice=Appendix)"
label(data$query_script_loc_db_4___10)="In which of the following does the researcher share a query script for Database 4: (choice=Body of Text)"
label(data$query_script_loc_db_4___11)="In which of the following does the researcher share a query script for Database 4: (choice=Not Stated)"
label(data$query_format_db_4)="In what format are query documentation files shared for database 4?"
label(data$query_script_comments_4)="Does the shared query script for database 4 contain comments and/or notations for ease of reproducibility?"
label(data$query_doc_open_db_4)="Are query resources used throughout data collection proprietary or non-proprietary for database 4?"
label(data$db_metadata_4)="Does the author share the dataset metadata for database 4?"
label(data$db_4_restriction)="Level of restriction for database 4"
label(data$db_charge_4)="Must one pay for access to database 4?"
label(data$query_missing_reason)="Does the researcher state a reason for not sharing a query script?"
label(data$reason_no_query_share)="Please briefly explain the authors reasoning for not sharing a query script."
label(data$databases_missing_script)="For how many databases does the researcher fail to share a query script?"
label(data$inclusion_and_exclusion_stated)="Does the publication or shared query material(s) state cohort inclusion and exclusion criteria?"
label(data$inclusion_exclu_location___1)="States cohort inclusion and exclusion criteria in the following location: (choice=Supplementary materials)"
label(data$inclusion_exclu_location___2)="States cohort inclusion and exclusion criteria in the following location: (choice=Appendix)"
label(data$inclusion_exclu_location___3)="States cohort inclusion and exclusion criteria in the following location: (choice=Body of text)"
label(data$inclusion_exclu_location___4)="States cohort inclusion and exclusion criteria in the following location: (choice=Query script code or comments)"
label(data$ontol_and_vocab_stated)="Are inclusion and exclusion criteria operationalized using standard ontologies and vocabularies?"
label(data$ontologies_vocab_location___1)="States standard ontologies and vocabularies in the following location: (choice=Supplementary materials)"
label(data$ontologies_vocab_location___2)="States standard ontologies and vocabularies in the following location: (choice=Appendix)"
label(data$ontologies_vocab_location___3)="States standard ontologies and vocabularies in the following location: (choice=Body of text)"
label(data$ontologies_vocab_location___4)="States standard ontologies and vocabularies in the following location: (choice=Query script code or comments)"
label(data$proc_vocabulary___1)="Procedure vocabulary adopted: (choice=CPT)"
label(data$proc_vocabulary___2)="Procedure vocabulary adopted: (choice=ICD)"
label(data$proc_vocabulary___3)="Procedure vocabulary adopted: (choice=SNOMED)"
label(data$proc_vocabulary___4)="Procedure vocabulary adopted: (choice=Other)"
label(data$other_proc_vocab)="Other procedure vocabulary adopted"
label(data$diag_vocabulary___1)="Diagnosis vocabulary adopted: (choice=ICD9)"
label(data$diag_vocabulary___2)="Diagnosis vocabulary adopted: (choice=ICD10)"
label(data$diag_vocabulary___3)="Diagnosis vocabulary adopted: (choice=DSM)"
label(data$diag_vocabulary___4)="Diagnosis vocabulary adopted: (choice=SNOMED)"
label(data$diag_vocabulary___5)="Diagnosis vocabulary adopted: (choice=Other)"
label(data$other_diagnosis_vocab)="Other diagnosis vocabulary adopted:"
label(data$med_vocab___1)="Medication vocabulary adopted (choice=SNOMED)"
label(data$med_vocab___2)="Medication vocabulary adopted (choice=RXNorm)"
label(data$med_vocab___3)="Medication vocabulary adopted (choice=Other)"
label(data$other_med_vocab)="Other medication vocabulary adopted:"
label(data$lab_vocab___1)="Laboratory vocabulary adopted: (choice=LOINC)"
label(data$lab_vocab___2)="Laboratory vocabulary adopted: (choice=Other)"
label(data$other_lab_vocab)="Other laboratory vocabulary"
label(data$database_and_data_collection_complete)="Complete?"
label(data$text_nlp_yn)="Does the research involve natural language processing or text mining?"
label(data$text_mine_source)="Does the manuscript state the source of the text from which data was mined?"
label(data$text_mining_preprocess)="Is a version of the original pre-processing sample text source shared?"
label(data$nlp_source_shared_loc___0)="In which of the following is the source text shared? (choice=Not Applicable)"
label(data$nlp_source_shared_loc___1)="In which of the following is the source text shared? (choice=Affiliated Research Center Website)"
label(data$nlp_source_shared_loc___2)="In which of the following is the source text shared? (choice=Authors Institution or Departmental Website)"
label(data$nlp_source_shared_loc___3)="In which of the following is the source text shared? (choice=Data Registry)"
label(data$nlp_source_shared_loc___4)="In which of the following is the source text shared? (choice=Journal or Publications Website)"
label(data$nlp_source_shared_loc___5)="In which of the following is the source text shared? (choice=GitHub)"
label(data$nlp_source_shared_loc___6)="In which of the following is the source text shared? (choice=Dataset Metadata)"
label(data$nlp_source_shared_loc___7)="In which of the following is the source text shared? (choice=Readme file)"
label(data$nlp_source_shared_loc___8)="In which of the following is the source text shared? (choice=Supplementary Materials)"
label(data$nlp_source_shared_loc___9)="In which of the following is the source text shared? (choice=Appendix)"
label(data$nlp_source_shared_loc___10)="In which of the following is the source text shared? (choice=Body of Text)"
label(data$nlp_validation)="Does the publication clearly state a processes for validating data mined via nlp and/or queried from a database?"
label(data$nlp_software)="Please list all software applications used for text mining:"
label(data$nlp_software_open___1)="Is the text mining software application proprietary or open? (choice=Proprietary)"
label(data$nlp_software_open___2)="Is the text mining software application proprietary or open? (choice=Open)"
label(data$nlp_software_open___3)="Is the text mining software application proprietary or open? (choice=Mixed)"
label(data$nlp_interoperable)="Are the text mining materials shared in a format interoperable with systems other than the authors chosen software application?"
label(data$nlp_file_formats)="In what format are text mining files shared?"
label(data$data_cleaned_yn)="Does the author state how data were cleaned?"
label(data$data_clean_docu_loc___1)="In which of the following does the author describe any data cleaning procedures? (choice=Dataset Metadata)"
label(data$data_clean_docu_loc___2)="In which of the following does the author describe any data cleaning procedures? (choice=Supplementary Materials)"
label(data$data_clean_docu_loc___3)="In which of the following does the author describe any data cleaning procedures? (choice=Appendix)"
label(data$data_clean_docu_loc___4)="In which of the following does the author describe any data cleaning procedures? (choice=Body of Text)"
label(data$data_merged_yn)="Does the author state how data were merged?"
label(data$data_merge_docu_loc___1)="In which of the following does the author describe any data merging procedures? (choice=Dataset Metadata)"
label(data$data_merge_docu_loc___2)="In which of the following does the author describe any data merging procedures? (choice=Supplementary Materials)"
label(data$data_merge_docu_loc___3)="In which of the following does the author describe any data merging procedures? (choice=Appendix)"
label(data$data_merge_docu_loc___4)="In which of the following does the author describe any data merging procedures? (choice=Body of Text)"
label(data$data_merge_id)="Does the author or analyst use a patient primary identifier - such as SSN, UPI, or MRN - throughout merging besides FN, LN, DOB?"
label(data$messy_variables_process)="Does the author state any clear process documented for cleaning messy or ambiguous records?"
label(data$data_messy_docu_loc___1)="In which of the following does the author describe any procedures for accounting for messy or ambiguous data? (choice=Dataset Metadata)"
label(data$data_messy_docu_loc___2)="In which of the following does the author describe any procedures for accounting for messy or ambiguous data? (choice=Supplementary Materials)"
label(data$data_messy_docu_loc___3)="In which of the following does the author describe any procedures for accounting for messy or ambiguous data? (choice=Appendix)"
label(data$data_messy_docu_loc___4)="In which of the following does the author describe any procedures for accounting for messy or ambiguous data? (choice=Body of Text)"
label(data$missing_variables_process)="Does the author state any clear process documented for accounting for missing data?"
label(data$data_missing_docu_loc___1)="In which of the following does the author describe any procedures for accounting for missing data? (choice=Dataset Metadata)"
label(data$data_missing_docu_loc___2)="In which of the following does the author describe any procedures for accounting for missing data? (choice=Supplementary Materials)"
label(data$data_missing_docu_loc___3)="In which of the following does the author describe any procedures for accounting for missing data? (choice=Appendix)"
label(data$data_missing_docu_loc___4)="In which of the following does the author describe any procedures for accounting for missing data? (choice=Body of Text)"
label(data$methods_data_mining_and_cleaning_complete)="Complete?"
label(data$analysis_code_shared)="Does the author share all code sufficient for data analysis?"
label(data$results_verifiable)="Are all results listed within the manuscripts results section verifiable via the shared analysis scripts?"
label(data$results_linked_to_code)="Are all results listed within the manuscripts results section linked to commented and index sections of code?"
label(data$analysis_script_commented)="Does the shared analysis code contain comments and/or notation for ease of reproducibility?"
label(data$analysis_processes_clear)="Does the author state analysis methodology and process?"
label(data$data_analysis_doc_loc___1)="In which of the following does the author describe any data analysis procedures? (choice=Dataset Metadata)"
label(data$data_analysis_doc_loc___2)="In which of the following does the author describe any data analysis procedures? (choice=Supplementary Materials)"
label(data$data_analysis_doc_loc___3)="In which of the following does the author describe any data analysis procedures? (choice=Appendix)"
label(data$data_analysis_doc_loc___4)="In which of the following does the author describe any data analysis procedures? (choice=Body of Text)"
label(data$software_analysis_code)="Does the author indicate the software used to develop the analysis code?"
label(data$analysis_sw)="Software used for data analysis"
label(data$analysis_sw_version)="Analysis software version number"
label(data$analysis_os)="Analysis software operating system"
label(data$analysis_software_open___1)="Is the analysis software proprietary or open? (choice=Proprietary)"
label(data$analysis_software_open___2)="Is the analysis software proprietary or open? (choice=Open)"
label(data$analysis_file_formats)="Analysis file formats shared"
label(data$analysis_code_shared_loc___1)="Where is the finalized data analysis code shared? (choice=Affiliated Research Center Website)"
label(data$analysis_code_shared_loc___2)="Where is the finalized data analysis code shared? (choice=Authors Institution or Departmental Website)"
label(data$analysis_code_shared_loc___3)="Where is the finalized data analysis code shared? (choice=Data Registry)"
label(data$analysis_code_shared_loc___4)="Where is the finalized data analysis code shared? (choice=Journal or Publications Website)"
label(data$analysis_code_shared_loc___5)="Where is the finalized data analysis code shared? (choice=GitHub)"
label(data$analysis_code_shared_loc___6)="Where is the finalized data analysis code shared? (choice=Dataset Metadata)"
label(data$analysis_code_shared_loc___7)="Where is the finalized data analysis code shared? (choice=Readme file)"
label(data$analysis_code_shared_loc___8)="Where is the finalized data analysis code shared? (choice=Supplementary Materials)"
label(data$analysis_code_shared_loc___9)="Where is the finalized data analysis code shared? (choice=Appendix)"
label(data$analysis_code_shared_loc___10)="Where is the finalized data analysis code shared? (choice=Body of Text)"
label(data$analysis_code_shared_loc___11)="Where is the finalized data analysis code shared? (choice=Not stated)"
label(data$analysis_request_restrict___1)="What is the level of restriction for requesting the data analysis script? (choice=Closed)"
label(data$analysis_request_restrict___2)="What is the level of restriction for requesting the data analysis script? (choice=Restricted departmental database)"
label(data$analysis_request_restrict___3)="What is the level of restriction for requesting the data analysis script? (choice=Restricted to within authors institution or practice)"
label(data$analysis_request_restrict___4)="What is the level of restriction for requesting the data analysis script? (choice=Restricted access requiring data request and IRB)"
label(data$analysis_request_restrict___5)="What is the level of restriction for requesting the data analysis script? (choice=Restricted access requiring data request)"
label(data$analysis_request_restrict___6)="What is the level of restriction for requesting the data analysis script? (choice=Open to public)"
label(data$methods_data_analysis_complete)="Complete?"
label(data$final_dataset_shared)="Is the finalized dataset shared?"
label(data$final_dataset_shared_loc___1)="Where is the finalized dataset shared? (choice=Affiliated Research Center Website)"
label(data$final_dataset_shared_loc___2)="Where is the finalized dataset shared? (choice=Authors Institution or Departmental Website)"
label(data$final_dataset_shared_loc___3)="Where is the finalized dataset shared? (choice=Data Registry)"
label(data$final_dataset_shared_loc___4)="Where is the finalized dataset shared? (choice=Journal or Publications Website)"
label(data$final_dataset_shared_loc___5)="Where is the finalized dataset shared? (choice=GitHub)"
label(data$final_dataset_shared_loc___6)="Where is the finalized dataset shared? (choice=Other)"
label(data$other_data_share)="If Other, where?"
label(data$data_requesting_process)="Is there a clear process for requesting the data?"
label(data$data_req_doc_loc___1)="Which of the following specifies a data request process? (choice=Affiliated Research Center Website)"
label(data$data_req_doc_loc___2)="Which of the following specifies a data request process? (choice=Authors Institution or Departmental Website)"
label(data$data_req_doc_loc___3)="Which of the following specifies a data request process? (choice=Data Registry)"
label(data$data_req_doc_loc___4)="Which of the following specifies a data request process? (choice=Journal or Publications Website)"
label(data$data_req_doc_loc___5)="Which of the following specifies a data request process? (choice=Supplementary Materials)"
label(data$data_req_doc_loc___6)="Which of the following specifies a data request process? (choice=Appendix)"
label(data$data_req_doc_loc___7)="Which of the following specifies a data request process? (choice=Body of text)"
label(data$data_req_doc_loc___8)="Which of the following specifies a data request process? (choice=Other)"
label(data$data_req_doc_loc_other)="If Other, where?"
label(data$journal_datasharing_policy)="Does the journal of publication have a data sharing policy?"
label(data$share_policy_url)="If yes, please input the data sharing url:"
label(data$data_req_access)="What is the level of restriction for requesting the data?"
label(data$data_req_access_other)="If other, please indicate level of restriction for requesting the data"
label(data$data_req_charge)="Is there a charge associated with requesting the data?"
label(data$readme_file_shared)="Does the author share a readme file with each dataset?"
label(data$rm_clear_contents)="Does the readme file contain clear documentation of dataset contents and related metadata?"
label(data$rm_metadata_standard)="Does the author indicate an existing metadata standard they are applying within their metadata?"
label(data$rm_filing_naming_convention)="Does the author document any form of adopted file naming convention?"
label(data$rm_index)="Are contents within the readme file organized through some form of index?"
label(data$rm_inventory)="Does the readme file contain an inventory of research data contents?"
label(data$rm_license_rights)="Does the readme file document any associated licenses or rights of reuse for the associated research data and materials?"
label(data$rm_abstract_proj_descr)="Does the readme file contain a project abstract or project description?"
label(data$rm_creation_dates)="Does the readme file state creation dates for all referenced files and datasets?"
label(data$rm_ref_pub_supplementary)="Does the readme file reference related publications or supplementary materials?"
label(data$rm_operating_systems)="Does the readme file explain the relevant operating systems used throughout the creation of inventoried files?"
label(data$rm_sw_version_numbers)="Does the readme file document the relevant software version numbers adopted throughout the research process?"
label(data$rm_limitations)="Does the readme file document limitations associated with the associated research methods or shared data?"
label(data$limitations_where___1)="In which of the following locations are project or data limitations documented? (choice=Affiliated Research Center Website)"
label(data$limitations_where___2)="In which of the following locations are project or data limitations documented? (choice=Authors Institution or Departmental Website)"
label(data$limitations_where___3)="In which of the following locations are project or data limitations documented? (choice=Data Registry)"
label(data$limitations_where___4)="In which of the following locations are project or data limitations documented? (choice=Journal or Publications Website)"
label(data$limitations_where___5)="In which of the following locations are project or data limitations documented? (choice=Supplementary Materials)"
label(data$limitations_where___6)="In which of the following locations are project or data limitations documented? (choice=Appendix)"
label(data$limitations_where___7)="In which of the following locations are project or data limitations documented? (choice=Body of Text)"
label(data$limitations_where___8)="In which of the following locations are project or data limitations documented? (choice=Other)"
label(data$data_dictionary_shared)="Does the author share a data dictionary for all datasets?"
label(data$data_dictionary_location___1)="In which of the following locations is the data dictionary shared? (choice=Affiliated Research Center Website)"
label(data$data_dictionary_location___2)="In which of the following locations is the data dictionary shared? (choice=Authors Institution or Departmental Website)"
label(data$data_dictionary_location___3)="In which of the following locations is the data dictionary shared? (choice=Data Registry)"
label(data$data_dictionary_location___4)="In which of the following locations is the data dictionary shared? (choice=Journal or Publications Website)"
label(data$data_dictionary_location___5)="In which of the following locations is the data dictionary shared? (choice=GitHub)"
label(data$data_dictionary_location___6)="In which of the following locations is the data dictionary shared? (choice=Dataset Metadata)"
label(data$data_dictionary_location___7)="In which of the following locations is the data dictionary shared? (choice=Readme file)"
label(data$data_dictionary_location___8)="In which of the following locations is the data dictionary shared? (choice=Supplementary Materials)"
label(data$data_dictionary_location___9)="In which of the following locations is the data dictionary shared? (choice=Appendix)"
label(data$data_dictionary_location___10)="In which of the following locations is the data dictionary shared? (choice=Body of Text)"
label(data$data_dictionary_location___11)="In which of the following locations is the data dictionary shared? (choice=Other)"
label(data$dd_variables_intelligble)="Are all variables clearly intelligible to those within the clinical domain?"
label(data$dd_abbreviations_limited)="Is the use of abbreviations within the data dictionary and associated data documentation limited?"
label(data$dd_abbreviations_defined)="Are all abbreviations spelled out and defined in metadata?"
label(data$dd_truncated_variables)="Are truncated variable titles spelled out in full within the data dictionary?"
label(data$dd_coded_var_labels)="Are all coded variable labels assigned clear definitions?"
label(data$central_data_request)="Are all datasets and data documentation files available through the same centralized request mechanism(s)?"
label(data$data_assigned_obj_identifiers)="Are all data materials given a unique identifier?"
label(data$data_discoverability_tags)="Are all data materials given tags to aid in discoverability?"
label(data$data_sharing_and_data_documentation_complete)="Complete?"
#Setting Units


#Setting Factors(will create new variable for factors)
data$clinical_domain.factor = factor(data$clinical_domain,levels=c("1","2","3","4","5","6","7","8","9","10","11","12","13","14","15","16","17","18","19","20","21","22","23","24","25","26","27","28","29","30","31","32","33","34","35","36","37","38","39","40","41","42"))
data$primary_research.factor = factor(data$primary_research,levels=c("1","0"))
data$meta_analysis.factor = factor(data$meta_analysis,levels=c("1","0"))
data$reproducibilityresearch_yn.factor = factor(data$reproducibilityresearch_yn,levels=c("1","0"))
data$hypothesis_gen_or_driv.factor = factor(data$hypothesis_gen_or_driv,levels=c("1","2","3"))
data$clear_hypothesis.factor = factor(data$clear_hypothesis,levels=c("1","2","3","4"))
data$reviewer.factor = factor(data$reviewer,levels=c("1","2","3","4","5","6","7", "8"))
data$publication_overview_and_bibliographic_information_complete.factor = factor(data$publication_overview_and_bibliographic_information_complete,levels=c("0","1","2"))
data$state_data_sources.factor = factor(data$state_data_sources,levels=c("1","0"))
data$state_database_where___1.factor = factor(data$state_database_where___1,levels=c("0","1"))
data$state_database_where___2.factor = factor(data$state_database_where___2,levels=c("0","1"))
data$state_database_where___3.factor = factor(data$state_database_where___3,levels=c("0","1"))
data$state_database_where___4.factor = factor(data$state_database_where___4,levels=c("0","1"))
data$database_cited.factor = factor(data$database_cited,levels=c("1","0"))
data$query_script_shared.factor = factor(data$query_script_shared,levels=c("1","0"))
data$query_method_stated.factor = factor(data$query_method_stated,levels=c("1","0"))
data$query_method_location___2.factor = factor(data$query_method_location___2,levels=c("0","1"))
data$query_method_location___3.factor = factor(data$query_method_location___3,levels=c("0","1"))
data$query_method_location___4.factor = factor(data$query_method_location___4,levels=c("0","1"))
data$query_method_db_1___2.factor = factor(data$query_method_db_1___2,levels=c("0","1"))
data$query_method_db_1___3.factor = factor(data$query_method_db_1___3,levels=c("0","1"))
data$query_method_db_1___4.factor = factor(data$query_method_db_1___4,levels=c("0","1"))
data$query_method_db_1___5.factor = factor(data$query_method_db_1___5,levels=c("0","1"))
data$query_script_loc_db_1___1.factor = factor(data$query_script_loc_db_1___1,levels=c("0","1"))
data$query_script_loc_db_1___2.factor = factor(data$query_script_loc_db_1___2,levels=c("0","1"))
data$query_script_loc_db_1___3.factor = factor(data$query_script_loc_db_1___3,levels=c("0","1"))
data$query_script_loc_db_1___4.factor = factor(data$query_script_loc_db_1___4,levels=c("0","1"))
data$query_script_loc_db_1___5.factor = factor(data$query_script_loc_db_1___5,levels=c("0","1"))
data$query_script_loc_db_1___6.factor = factor(data$query_script_loc_db_1___6,levels=c("0","1"))
data$query_script_loc_db_1___7.factor = factor(data$query_script_loc_db_1___7,levels=c("0","1"))
data$query_script_loc_db_1___8.factor = factor(data$query_script_loc_db_1___8,levels=c("0","1"))
data$query_script_loc_db_1___9.factor = factor(data$query_script_loc_db_1___9,levels=c("0","1"))
data$query_script_loc_db_1___10.factor = factor(data$query_script_loc_db_1___10,levels=c("0","1"))
data$query_script_loc_db_1___11.factor = factor(data$query_script_loc_db_1___11,levels=c("0","1"))
data$query_script_comments_1.factor = factor(data$query_script_comments_1,levels=c("1","0"))
data$query_doc_open_db_1.factor = factor(data$query_doc_open_db_1,levels=c("1","2"))
data$db_metadata_1.factor = factor(data$db_metadata_1,levels=c("1","0"))
data$restriction_db_1.factor = factor(data$restriction_db_1,levels=c("1","2","3","4","5","6","7"))
data$db_charge_1.factor = factor(data$db_charge_1,levels=c("0","1","2"))
data$query_method_db_2___1.factor = factor(data$query_method_db_2___1,levels=c("0","1"))
data$query_method_db_2___2.factor = factor(data$query_method_db_2___2,levels=c("0","1"))
data$query_method_db_2___3.factor = factor(data$query_method_db_2___3,levels=c("0","1"))
data$query_method_db_2___4.factor = factor(data$query_method_db_2___4,levels=c("0","1"))
data$query_script_loc_db_2___1.factor = factor(data$query_script_loc_db_2___1,levels=c("0","1"))
data$query_script_loc_db_2___2.factor = factor(data$query_script_loc_db_2___2,levels=c("0","1"))
data$query_script_loc_db_2___3.factor = factor(data$query_script_loc_db_2___3,levels=c("0","1"))
data$query_script_loc_db_2___4.factor = factor(data$query_script_loc_db_2___4,levels=c("0","1"))
data$query_script_loc_db_2___5.factor = factor(data$query_script_loc_db_2___5,levels=c("0","1"))
data$query_script_loc_db_2___6.factor = factor(data$query_script_loc_db_2___6,levels=c("0","1"))
data$query_script_loc_db_2___7.factor = factor(data$query_script_loc_db_2___7,levels=c("0","1"))
data$query_script_loc_db_2___8.factor = factor(data$query_script_loc_db_2___8,levels=c("0","1"))
data$query_script_loc_db_2___9.factor = factor(data$query_script_loc_db_2___9,levels=c("0","1"))
data$query_script_loc_db_2___10.factor = factor(data$query_script_loc_db_2___10,levels=c("0","1"))
data$query_script_loc_db_2___11.factor = factor(data$query_script_loc_db_2___11,levels=c("0","1"))
data$query_script_comments_2.factor = factor(data$query_script_comments_2,levels=c("1","0"))
data$query_doc_open_db_2.factor = factor(data$query_doc_open_db_2,levels=c("1","2"))
data$db_metadata_2.factor = factor(data$db_metadata_2,levels=c("1","0"))
data$db_2_restriction.factor = factor(data$db_2_restriction,levels=c("1","2","3","4","5","6","7"))
data$db_charge_2.factor = factor(data$db_charge_2,levels=c("0","1","2"))
data$query_method_3___1.factor = factor(data$query_method_3___1,levels=c("0","1"))
data$query_method_3___2.factor = factor(data$query_method_3___2,levels=c("0","1"))
data$query_method_3___3.factor = factor(data$query_method_3___3,levels=c("0","1"))
data$query_method_3___4.factor = factor(data$query_method_3___4,levels=c("0","1"))
data$query_script_loc_db_3___1.factor = factor(data$query_script_loc_db_3___1,levels=c("0","1"))
data$query_script_loc_db_3___2.factor = factor(data$query_script_loc_db_3___2,levels=c("0","1"))
data$query_script_loc_db_3___3.factor = factor(data$query_script_loc_db_3___3,levels=c("0","1"))
data$query_script_loc_db_3___4.factor = factor(data$query_script_loc_db_3___4,levels=c("0","1"))
data$query_script_loc_db_3___5.factor = factor(data$query_script_loc_db_3___5,levels=c("0","1"))
data$query_script_loc_db_3___6.factor = factor(data$query_script_loc_db_3___6,levels=c("0","1"))
data$query_script_loc_db_3___7.factor = factor(data$query_script_loc_db_3___7,levels=c("0","1"))
data$query_script_loc_db_3___8.factor = factor(data$query_script_loc_db_3___8,levels=c("0","1"))
data$query_script_loc_db_3___9.factor = factor(data$query_script_loc_db_3___9,levels=c("0","1"))
data$query_script_loc_db_3___10.factor = factor(data$query_script_loc_db_3___10,levels=c("0","1"))
data$query_script_loc_db_3___11.factor = factor(data$query_script_loc_db_3___11,levels=c("0","1"))
data$query_script_comments_3.factor = factor(data$query_script_comments_3,levels=c("1","0"))
data$query_doc_open_db_3.factor = factor(data$query_doc_open_db_3,levels=c("1","2"))
data$db_metadata_3.factor = factor(data$db_metadata_3,levels=c("1","0"))
data$db_3_restriction.factor = factor(data$db_3_restriction,levels=c("1","2","3","4","5","6","7"))
data$db_charge_3.factor = factor(data$db_charge_3,levels=c("0","1","2"))
data$query_method_4___1.factor = factor(data$query_method_4___1,levels=c("0","1"))
data$query_method_4___2.factor = factor(data$query_method_4___2,levels=c("0","1"))
data$query_method_4___3.factor = factor(data$query_method_4___3,levels=c("0","1"))
data$query_method_4___4.factor = factor(data$query_method_4___4,levels=c("0","1"))
data$query_script_loc_db_4___1.factor = factor(data$query_script_loc_db_4___1,levels=c("0","1"))
data$query_script_loc_db_4___2.factor = factor(data$query_script_loc_db_4___2,levels=c("0","1"))
data$query_script_loc_db_4___3.factor = factor(data$query_script_loc_db_4___3,levels=c("0","1"))
data$query_script_loc_db_4___4.factor = factor(data$query_script_loc_db_4___4,levels=c("0","1"))
data$query_script_loc_db_4___5.factor = factor(data$query_script_loc_db_4___5,levels=c("0","1"))
data$query_script_loc_db_4___6.factor = factor(data$query_script_loc_db_4___6,levels=c("0","1"))
data$query_script_loc_db_4___7.factor = factor(data$query_script_loc_db_4___7,levels=c("0","1"))
data$query_script_loc_db_4___8.factor = factor(data$query_script_loc_db_4___8,levels=c("0","1"))
data$query_script_loc_db_4___9.factor = factor(data$query_script_loc_db_4___9,levels=c("0","1"))
data$query_script_loc_db_4___10.factor = factor(data$query_script_loc_db_4___10,levels=c("0","1"))
data$query_script_loc_db_4___11.factor = factor(data$query_script_loc_db_4___11,levels=c("0","1"))
data$query_script_comments_4.factor = factor(data$query_script_comments_4,levels=c("1","0"))
data$query_doc_open_db_4.factor = factor(data$query_doc_open_db_4,levels=c("1","2"))
data$db_metadata_4.factor = factor(data$db_metadata_4,levels=c("1","0"))
data$db_4_restriction.factor = factor(data$db_4_restriction,levels=c("1","2","3","4","6","7"))
data$db_charge_4.factor = factor(data$db_charge_4,levels=c("0","1","2"))
data$query_missing_reason.factor = factor(data$query_missing_reason,levels=c("1","0"))
data$databases_missing_script.factor = factor(data$databases_missing_script,levels=c("1","2","3","4","5","6"))
data$inclusion_and_exclusion_stated.factor = factor(data$inclusion_and_exclusion_stated,levels=c("1","0"))
data$inclusion_exclu_location___1.factor = factor(data$inclusion_exclu_location___1,levels=c("0","1"))
data$inclusion_exclu_location___2.factor = factor(data$inclusion_exclu_location___2,levels=c("0","1"))
data$inclusion_exclu_location___3.factor = factor(data$inclusion_exclu_location___3,levels=c("0","1"))
data$inclusion_exclu_location___4.factor = factor(data$inclusion_exclu_location___4,levels=c("0","1"))
data$ontol_and_vocab_stated.factor = factor(data$ontol_and_vocab_stated,levels=c("1","0"))
data$ontologies_vocab_location___1.factor = factor(data$ontologies_vocab_location___1,levels=c("0","1"))
data$ontologies_vocab_location___2.factor = factor(data$ontologies_vocab_location___2,levels=c("0","1"))
data$ontologies_vocab_location___3.factor = factor(data$ontologies_vocab_location___3,levels=c("0","1"))
data$ontologies_vocab_location___4.factor = factor(data$ontologies_vocab_location___4,levels=c("0","1"))
data$proc_vocabulary___1.factor = factor(data$proc_vocabulary___1,levels=c("0","1"))
data$proc_vocabulary___2.factor = factor(data$proc_vocabulary___2,levels=c("0","1"))
data$proc_vocabulary___3.factor = factor(data$proc_vocabulary___3,levels=c("0","1"))
data$proc_vocabulary___4.factor = factor(data$proc_vocabulary___4,levels=c("0","1"))
data$diag_vocabulary___1.factor = factor(data$diag_vocabulary___1,levels=c("0","1"))
data$diag_vocabulary___2.factor = factor(data$diag_vocabulary___2,levels=c("0","1"))
data$diag_vocabulary___3.factor = factor(data$diag_vocabulary___3,levels=c("0","1"))
data$diag_vocabulary___4.factor = factor(data$diag_vocabulary___4,levels=c("0","1"))
data$diag_vocabulary___5.factor = factor(data$diag_vocabulary___5,levels=c("0","1"))
data$med_vocab___1.factor = factor(data$med_vocab___1,levels=c("0","1"))
data$med_vocab___2.factor = factor(data$med_vocab___2,levels=c("0","1"))
data$med_vocab___3.factor = factor(data$med_vocab___3,levels=c("0","1"))
data$lab_vocab___1.factor = factor(data$lab_vocab___1,levels=c("0","1"))
data$lab_vocab___2.factor = factor(data$lab_vocab___2,levels=c("0","1"))
data$database_and_data_collection_complete.factor = factor(data$database_and_data_collection_complete,levels=c("0","1","2"))
data$text_nlp_yn.factor = factor(data$text_nlp_yn,levels=c("1","0"))
data$text_mine_source.factor = factor(data$text_mine_source,levels=c("1","0"))
data$text_mining_preprocess.factor = factor(data$text_mining_preprocess,levels=c("1","0"))
data$nlp_source_shared_loc___0.factor = factor(data$nlp_source_shared_loc___0,levels=c("0","1"))
data$nlp_source_shared_loc___1.factor = factor(data$nlp_source_shared_loc___1,levels=c("0","1"))
data$nlp_source_shared_loc___2.factor = factor(data$nlp_source_shared_loc___2,levels=c("0","1"))
data$nlp_source_shared_loc___3.factor = factor(data$nlp_source_shared_loc___3,levels=c("0","1"))
data$nlp_source_shared_loc___4.factor = factor(data$nlp_source_shared_loc___4,levels=c("0","1"))
data$nlp_source_shared_loc___5.factor = factor(data$nlp_source_shared_loc___5,levels=c("0","1"))
data$nlp_source_shared_loc___6.factor = factor(data$nlp_source_shared_loc___6,levels=c("0","1"))
data$nlp_source_shared_loc___7.factor = factor(data$nlp_source_shared_loc___7,levels=c("0","1"))
data$nlp_source_shared_loc___8.factor = factor(data$nlp_source_shared_loc___8,levels=c("0","1"))
data$nlp_source_shared_loc___9.factor = factor(data$nlp_source_shared_loc___9,levels=c("0","1"))
data$nlp_source_shared_loc___10.factor = factor(data$nlp_source_shared_loc___10,levels=c("0","1"))
data$nlp_validation.factor = factor(data$nlp_validation,levels=c("1","0"))
data$nlp_software_open___1.factor = factor(data$nlp_software_open___1,levels=c("0","1"))
data$nlp_software_open___2.factor = factor(data$nlp_software_open___2,levels=c("0","1"))
data$nlp_software_open___3.factor = factor(data$nlp_software_open___3,levels=c("0","1"))
data$nlp_interoperable.factor = factor(data$nlp_interoperable,levels=c("1","0"))
data$data_cleaned_yn.factor = factor(data$data_cleaned_yn,levels=c("1","0"))
data$data_clean_docu_loc___1.factor = factor(data$data_clean_docu_loc___1,levels=c("0","1"))
data$data_clean_docu_loc___2.factor = factor(data$data_clean_docu_loc___2,levels=c("0","1"))
data$data_clean_docu_loc___3.factor = factor(data$data_clean_docu_loc___3,levels=c("0","1"))
data$data_clean_docu_loc___4.factor = factor(data$data_clean_docu_loc___4,levels=c("0","1"))
data$data_merged_yn.factor = factor(data$data_merged_yn,levels=c("1","0"))
data$data_merge_docu_loc___1.factor = factor(data$data_merge_docu_loc___1,levels=c("0","1"))
data$data_merge_docu_loc___2.factor = factor(data$data_merge_docu_loc___2,levels=c("0","1"))
data$data_merge_docu_loc___3.factor = factor(data$data_merge_docu_loc___3,levels=c("0","1"))
data$data_merge_docu_loc___4.factor = factor(data$data_merge_docu_loc___4,levels=c("0","1"))
data$data_merge_id.factor = factor(data$data_merge_id,levels=c("1","0"))
data$messy_variables_process.factor = factor(data$messy_variables_process,levels=c("1","0"))
data$data_messy_docu_loc___1.factor = factor(data$data_messy_docu_loc___1,levels=c("0","1"))
data$data_messy_docu_loc___2.factor = factor(data$data_messy_docu_loc___2,levels=c("0","1"))
data$data_messy_docu_loc___3.factor = factor(data$data_messy_docu_loc___3,levels=c("0","1"))
data$data_messy_docu_loc___4.factor = factor(data$data_messy_docu_loc___4,levels=c("0","1"))
data$missing_variables_process.factor = factor(data$missing_variables_process,levels=c("1","0"))
data$data_missing_docu_loc___1.factor = factor(data$data_missing_docu_loc___1,levels=c("0","1"))
data$data_missing_docu_loc___2.factor = factor(data$data_missing_docu_loc___2,levels=c("0","1"))
data$data_missing_docu_loc___3.factor = factor(data$data_missing_docu_loc___3,levels=c("0","1"))
data$data_missing_docu_loc___4.factor = factor(data$data_missing_docu_loc___4,levels=c("0","1"))
data$methods_data_mining_and_cleaning_complete.factor = factor(data$methods_data_mining_and_cleaning_complete,levels=c("0","1","2"))
data$analysis_code_shared.factor = factor(data$analysis_code_shared,levels=c("1","0"))
data$results_verifiable.factor = factor(data$results_verifiable,levels=c("1","2","3"))
data$results_linked_to_code.factor = factor(data$results_linked_to_code,levels=c("1","0"))
data$analysis_script_commented.factor = factor(data$analysis_script_commented,levels=c("1","0"))
data$analysis_processes_clear.factor = factor(data$analysis_processes_clear,levels=c("1","0"))
data$data_analysis_doc_loc___1.factor = factor(data$data_analysis_doc_loc___1,levels=c("0","1"))
data$data_analysis_doc_loc___2.factor = factor(data$data_analysis_doc_loc___2,levels=c("0","1"))
data$data_analysis_doc_loc___3.factor = factor(data$data_analysis_doc_loc___3,levels=c("0","1"))
data$data_analysis_doc_loc___4.factor = factor(data$data_analysis_doc_loc___4,levels=c("0","1"))
data$software_analysis_code.factor = factor(data$software_analysis_code,levels=c("1","0"))
data$analysis_software_open___1.factor = factor(data$analysis_software_open___1,levels=c("0","1"))
data$analysis_software_open___2.factor = factor(data$analysis_software_open___2,levels=c("0","1"))
data$analysis_code_shared_loc___1.factor = factor(data$analysis_code_shared_loc___1,levels=c("0","1"))
data$analysis_code_shared_loc___2.factor = factor(data$analysis_code_shared_loc___2,levels=c("0","1"))
data$analysis_code_shared_loc___3.factor = factor(data$analysis_code_shared_loc___3,levels=c("0","1"))
data$analysis_code_shared_loc___4.factor = factor(data$analysis_code_shared_loc___4,levels=c("0","1"))
data$analysis_code_shared_loc___5.factor = factor(data$analysis_code_shared_loc___5,levels=c("0","1"))
data$analysis_code_shared_loc___6.factor = factor(data$analysis_code_shared_loc___6,levels=c("0","1"))
data$analysis_code_shared_loc___7.factor = factor(data$analysis_code_shared_loc___7,levels=c("0","1"))
data$analysis_code_shared_loc___8.factor = factor(data$analysis_code_shared_loc___8,levels=c("0","1"))
data$analysis_code_shared_loc___9.factor = factor(data$analysis_code_shared_loc___9,levels=c("0","1"))
data$analysis_code_shared_loc___10.factor = factor(data$analysis_code_shared_loc___10,levels=c("0","1"))
data$analysis_code_shared_loc___11.factor = factor(data$analysis_code_shared_loc___11,levels=c("0","1"))
data$analysis_request_restrict___1.factor = factor(data$analysis_request_restrict___1,levels=c("0","1"))
data$analysis_request_restrict___2.factor = factor(data$analysis_request_restrict___2,levels=c("0","1"))
data$analysis_request_restrict___3.factor = factor(data$analysis_request_restrict___3,levels=c("0","1"))
data$analysis_request_restrict___4.factor = factor(data$analysis_request_restrict___4,levels=c("0","1"))
data$analysis_request_restrict___5.factor = factor(data$analysis_request_restrict___5,levels=c("0","1"))
data$analysis_request_restrict___6.factor = factor(data$analysis_request_restrict___6,levels=c("0","1"))
data$methods_data_analysis_complete.factor = factor(data$methods_data_analysis_complete,levels=c("0","1","2"))
data$final_dataset_shared.factor = factor(data$final_dataset_shared,levels=c("1","0"))
data$final_dataset_shared_loc___1.factor = factor(data$final_dataset_shared_loc___1,levels=c("0","1"))
data$final_dataset_shared_loc___2.factor = factor(data$final_dataset_shared_loc___2,levels=c("0","1"))
data$final_dataset_shared_loc___3.factor = factor(data$final_dataset_shared_loc___3,levels=c("0","1"))
data$final_dataset_shared_loc___4.factor = factor(data$final_dataset_shared_loc___4,levels=c("0","1"))
data$final_dataset_shared_loc___5.factor = factor(data$final_dataset_shared_loc___5,levels=c("0","1"))
data$final_dataset_shared_loc___6.factor = factor(data$final_dataset_shared_loc___6,levels=c("0","1"))
data$data_requesting_process.factor = factor(data$data_requesting_process,levels=c("1","0"))
data$data_req_doc_loc___1.factor = factor(data$data_req_doc_loc___1,levels=c("0","1"))
data$data_req_doc_loc___2.factor = factor(data$data_req_doc_loc___2,levels=c("0","1"))
data$data_req_doc_loc___3.factor = factor(data$data_req_doc_loc___3,levels=c("0","1"))
data$data_req_doc_loc___4.factor = factor(data$data_req_doc_loc___4,levels=c("0","1"))
data$data_req_doc_loc___5.factor = factor(data$data_req_doc_loc___5,levels=c("0","1"))
data$data_req_doc_loc___6.factor = factor(data$data_req_doc_loc___6,levels=c("0","1"))
data$data_req_doc_loc___7.factor = factor(data$data_req_doc_loc___7,levels=c("0","1"))
data$data_req_doc_loc___8.factor = factor(data$data_req_doc_loc___8,levels=c("0","1"))
data$journal_datasharing_policy.factor = factor(data$journal_datasharing_policy,levels=c("1","0","888"))
data$data_req_access.factor = factor(data$data_req_access,levels=c("1","2","3","4","5","6","7","888"))
data$data_req_charge.factor = factor(data$data_req_charge,levels=c("1","2","3","888"))
data$readme_file_shared.factor = factor(data$readme_file_shared,levels=c("1","0"))
data$rm_clear_contents.factor = factor(data$rm_clear_contents,levels=c("1","0"))
data$rm_metadata_standard.factor = factor(data$rm_metadata_standard,levels=c("1","0"))
data$rm_filing_naming_convention.factor = factor(data$rm_filing_naming_convention,levels=c("1","0"))
data$rm_index.factor = factor(data$rm_index,levels=c("1","0"))
data$rm_inventory.factor = factor(data$rm_inventory,levels=c("1","0"))
data$rm_license_rights.factor = factor(data$rm_license_rights,levels=c("1","0"))
data$rm_abstract_proj_descr.factor = factor(data$rm_abstract_proj_descr,levels=c("1","0"))
data$rm_creation_dates.factor = factor(data$rm_creation_dates,levels=c("1","0"))
data$rm_ref_pub_supplementary.factor = factor(data$rm_ref_pub_supplementary,levels=c("1","0"))
data$rm_operating_systems.factor = factor(data$rm_operating_systems,levels=c("1","0"))
data$rm_sw_version_numbers.factor = factor(data$rm_sw_version_numbers,levels=c("1","0"))
data$rm_limitations.factor = factor(data$rm_limitations,levels=c("1","0"))
data$limitations_where___1.factor = factor(data$limitations_where___1,levels=c("0","1"))
data$limitations_where___2.factor = factor(data$limitations_where___2,levels=c("0","1"))
data$limitations_where___3.factor = factor(data$limitations_where___3,levels=c("0","1"))
data$limitations_where___4.factor = factor(data$limitations_where___4,levels=c("0","1"))
data$limitations_where___5.factor = factor(data$limitations_where___5,levels=c("0","1"))
data$limitations_where___6.factor = factor(data$limitations_where___6,levels=c("0","1"))
data$limitations_where___7.factor = factor(data$limitations_where___7,levels=c("0","1"))
data$limitations_where___8.factor = factor(data$limitations_where___8,levels=c("0","1"))
data$data_dictionary_shared.factor = factor(data$data_dictionary_shared,levels=c("1","0"))
data$data_dictionary_location___1.factor = factor(data$data_dictionary_location___1,levels=c("0","1"))
data$data_dictionary_location___2.factor = factor(data$data_dictionary_location___2,levels=c("0","1"))
data$data_dictionary_location___3.factor = factor(data$data_dictionary_location___3,levels=c("0","1"))
data$data_dictionary_location___4.factor = factor(data$data_dictionary_location___4,levels=c("0","1"))
data$data_dictionary_location___5.factor = factor(data$data_dictionary_location___5,levels=c("0","1"))
data$data_dictionary_location___6.factor = factor(data$data_dictionary_location___6,levels=c("0","1"))
data$data_dictionary_location___7.factor = factor(data$data_dictionary_location___7,levels=c("0","1"))
data$data_dictionary_location___8.factor = factor(data$data_dictionary_location___8,levels=c("0","1"))
data$data_dictionary_location___9.factor = factor(data$data_dictionary_location___9,levels=c("0","1"))
data$data_dictionary_location___10.factor = factor(data$data_dictionary_location___10,levels=c("0","1"))
data$data_dictionary_location___11.factor = factor(data$data_dictionary_location___11,levels=c("0","1"))
data$dd_variables_intelligble.factor = factor(data$dd_variables_intelligble,levels=c("1","0"))
data$dd_abbreviations_limited.factor = factor(data$dd_abbreviations_limited,levels=c("1","0"))
data$dd_abbreviations_defined.factor = factor(data$dd_abbreviations_defined,levels=c("1","0"))
data$dd_truncated_variables.factor = factor(data$dd_truncated_variables,levels=c("1","0"))
data$dd_coded_var_labels.factor = factor(data$dd_coded_var_labels,levels=c("1","0"))
data$central_data_request.factor = factor(data$central_data_request,levels=c("1","0"))
data$data_assigned_obj_identifiers.factor = factor(data$data_assigned_obj_identifiers,levels=c("1","0"))
data$data_discoverability_tags.factor = factor(data$data_discoverability_tags,levels=c("1","0"))
data$data_sharing_and_data_documentation_complete.factor = factor(data$data_sharing_and_data_documentation_complete,levels=c("0","1","2"))


levels(data$clinical_domain.factor)=c("Allergy/Immunology","Anatomy and NeuroBiology","Anesthesiology","Biochemistry & Molecular Biophysics","Biostatistics","Bone and Mineral","Cardiology","Cell Biology & Physiology","Dermatology","Developmental Biology","Endocrinology Gastroenterology","General Med Sciences","Genetics","Geriatrics & Nutrition","Health Behavior Research","Hematology","Hospital Medicine","Infectious Diseases","Internal Medicine","McDonnell Genome Institute","Medical Education Oncology","Molecular Microbiology","Neurology","Neuroscience","Neurosurgery","Obstetrics & Gynecology","Occupational Therapy","Ophthalmology and Visual Sciences","Orthopaedic Surgery","Otolaryngology","Pathology & Immunology","Pediatrics","Pharmacogenomics","Physical Therapy","Psychiatry","Pulmonary","Radiation Oncology","Radiology","Renal","Rheumatology","Surgery","Other")
levels(data$primary_research.factor)=c("Yes","No")
levels(data$meta_analysis.factor)=c("Yes","No")
levels(data$reproducibilityresearch_yn.factor)=c("Yes","No")
levels(data$hypothesis_gen_or_driv.factor)=c("Hypothesis Driven","Hypothesis Generating","Unclear")
levels(data$clear_hypothesis.factor)=c("No","Unclear","Yes","Not Applicable")
levels(data$reviewer.factor)=c("Leslie McIntosh","Anthony Juehne","Cynthia Hudson-Vitale","Sam Johnson","Xiaoyan Liu","Christian Lukas","Roberta Grannemann", "Rosalia Alcoser")
levels(data$publication_overview_and_bibliographic_information_complete.factor)=c("Incomplete","Unverified","Complete")
levels(data$state_data_sources.factor)=c("Yes","No")
levels(data$state_database_where___1.factor)=c("Unchecked","Checked")
levels(data$state_database_where___2.factor)=c("Unchecked","Checked")
levels(data$state_database_where___3.factor)=c("Unchecked","Checked")
levels(data$state_database_where___4.factor)=c("Unchecked","Checked")
levels(data$database_cited.factor)=c("Yes","No")
levels(data$query_script_shared.factor)=c("Yes","No")
levels(data$query_method_stated.factor)=c("Yes","No")
levels(data$query_method_location___2.factor)=c("Unchecked","Checked")
levels(data$query_method_location___3.factor)=c("Unchecked","Checked")
levels(data$query_method_location___4.factor)=c("Unchecked","Checked")
levels(data$query_method_db_1___2.factor)=c("Unchecked","Checked")
levels(data$query_method_db_1___3.factor)=c("Unchecked","Checked")
levels(data$query_method_db_1___4.factor)=c("Unchecked","Checked")
levels(data$query_method_db_1___5.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___1.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___2.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___3.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___5.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___6.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___7.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___8.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___9.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___10.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_1___11.factor)=c("Unchecked","Checked")
levels(data$query_script_comments_1.factor)=c("Yes","No")
levels(data$query_doc_open_db_1.factor)=c("Proprietary","Non-Proprietary")
levels(data$db_metadata_1.factor)=c("Yes","No")
levels(data$restriction_db_1.factor)=c("Closed","Restricted departmental database","Restricted access to only those within authors institution or clinical practice","Restricted access requiring data request and IRB","Restricted access requiring data request","Open to public","Not Stated")
levels(data$db_charge_1.factor)=c("No","Yes","Not Applicable")
levels(data$query_method_db_2___1.factor)=c("Unchecked","Checked")
levels(data$query_method_db_2___2.factor)=c("Unchecked","Checked")
levels(data$query_method_db_2___3.factor)=c("Unchecked","Checked")
levels(data$query_method_db_2___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___1.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___2.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___3.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___5.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___6.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___7.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___8.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___9.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___10.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_2___11.factor)=c("Unchecked","Checked")
levels(data$query_script_comments_2.factor)=c("Yes","No")
levels(data$query_doc_open_db_2.factor)=c("Proprietary","Non-Proprietary")
levels(data$db_metadata_2.factor)=c("Yes","No")
levels(data$db_2_restriction.factor)=c("Closed","Restricted departmental database","Restricted access to only those within authors institution or clinical practice","Restricted access requiring data request and IRB","Restricted access requiring data request","Open to public","Not Stated")
levels(data$db_charge_2.factor)=c("No","Yes","Not Applicable")
levels(data$query_method_3___1.factor)=c("Unchecked","Checked")
levels(data$query_method_3___2.factor)=c("Unchecked","Checked")
levels(data$query_method_3___3.factor)=c("Unchecked","Checked")
levels(data$query_method_3___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___1.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___2.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___3.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___5.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___6.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___7.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___8.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___9.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___10.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_3___11.factor)=c("Unchecked","Checked")
levels(data$query_script_comments_3.factor)=c("Yes","No")
levels(data$query_doc_open_db_3.factor)=c("Proprietary","Non-Proprietary")
levels(data$db_metadata_3.factor)=c("Yes","No")
levels(data$db_3_restriction.factor)=c("Closed","Restricted departmental database","Restricted access to only those within authors institution or clinical practice","Restricted access requiring data request and IRB","Restricted access requiring data request","Open to public","Not Stated")
levels(data$db_charge_3.factor)=c("No","Yes","Not Applicable")
levels(data$query_method_4___1.factor)=c("Unchecked","Checked")
levels(data$query_method_4___2.factor)=c("Unchecked","Checked")
levels(data$query_method_4___3.factor)=c("Unchecked","Checked")
levels(data$query_method_4___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___1.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___2.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___3.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___4.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___5.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___6.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___7.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___8.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___9.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___10.factor)=c("Unchecked","Checked")
levels(data$query_script_loc_db_4___11.factor)=c("Unchecked","Checked")
levels(data$query_script_comments_4.factor)=c("Yes","No")
levels(data$query_doc_open_db_4.factor)=c("Proprietary","Non-Proprietary")
levels(data$db_metadata_4.factor)=c("Yes","No")
levels(data$db_4_restriction.factor)=c("Closed","Restricted departmental database","Restricted access to only those within authors institution or clinical practice","Restricted access requiring data request and IRB 5,Restricted access requiring data request","Open to public","Not Stated")
levels(data$db_charge_4.factor)=c("No","Yes","Not Applicable")
levels(data$query_missing_reason.factor)=c("Yes","No")
levels(data$databases_missing_script.factor)=c("1","2","3","4","5",">5")
levels(data$inclusion_and_exclusion_stated.factor)=c("Yes","No")
levels(data$inclusion_exclu_location___1.factor)=c("Unchecked","Checked")
levels(data$inclusion_exclu_location___2.factor)=c("Unchecked","Checked")
levels(data$inclusion_exclu_location___3.factor)=c("Unchecked","Checked")
levels(data$inclusion_exclu_location___4.factor)=c("Unchecked","Checked")
levels(data$ontol_and_vocab_stated.factor)=c("Yes","No")
levels(data$ontologies_vocab_location___1.factor)=c("Unchecked","Checked")
levels(data$ontologies_vocab_location___2.factor)=c("Unchecked","Checked")
levels(data$ontologies_vocab_location___3.factor)=c("Unchecked","Checked")
levels(data$ontologies_vocab_location___4.factor)=c("Unchecked","Checked")
levels(data$proc_vocabulary___1.factor)=c("Unchecked","Checked")
levels(data$proc_vocabulary___2.factor)=c("Unchecked","Checked")
levels(data$proc_vocabulary___3.factor)=c("Unchecked","Checked")
levels(data$proc_vocabulary___4.factor)=c("Unchecked","Checked")
levels(data$diag_vocabulary___1.factor)=c("Unchecked","Checked")
levels(data$diag_vocabulary___2.factor)=c("Unchecked","Checked")
levels(data$diag_vocabulary___3.factor)=c("Unchecked","Checked")
levels(data$diag_vocabulary___4.factor)=c("Unchecked","Checked")
levels(data$diag_vocabulary___5.factor)=c("Unchecked","Checked")
levels(data$med_vocab___1.factor)=c("Unchecked","Checked")
levels(data$med_vocab___2.factor)=c("Unchecked","Checked")
levels(data$med_vocab___3.factor)=c("Unchecked","Checked")
levels(data$lab_vocab___1.factor)=c("Unchecked","Checked")
levels(data$lab_vocab___2.factor)=c("Unchecked","Checked")
levels(data$database_and_data_collection_complete.factor)=c("Incomplete","Unverified","Complete")
levels(data$text_nlp_yn.factor)=c("Yes","No")
levels(data$text_mine_source.factor)=c("Yes","No")
levels(data$text_mining_preprocess.factor)=c("Yes","No")
levels(data$nlp_source_shared_loc___0.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___1.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___2.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___3.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___4.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___5.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___6.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___7.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___8.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___9.factor)=c("Unchecked","Checked")
levels(data$nlp_source_shared_loc___10.factor)=c("Unchecked","Checked")
levels(data$nlp_validation.factor)=c("Yes","No")
levels(data$nlp_software_open___1.factor)=c("Unchecked","Checked")
levels(data$nlp_software_open___2.factor)=c("Unchecked","Checked")
levels(data$nlp_software_open___3.factor)=c("Unchecked","Checked")
levels(data$nlp_interoperable.factor)=c("Yes","No")
levels(data$data_cleaned_yn.factor)=c("Yes","No")
levels(data$data_clean_docu_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_clean_docu_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_clean_docu_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_clean_docu_loc___4.factor)=c("Unchecked","Checked")
levels(data$data_merged_yn.factor)=c("Yes","No")
levels(data$data_merge_docu_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_merge_docu_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_merge_docu_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_merge_docu_loc___4.factor)=c("Unchecked","Checked")
levels(data$data_merge_id.factor)=c("Yes","No")
levels(data$messy_variables_process.factor)=c("Yes","No")
levels(data$data_messy_docu_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_messy_docu_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_messy_docu_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_messy_docu_loc___4.factor)=c("Unchecked","Checked")
levels(data$missing_variables_process.factor)=c("Yes","No")
levels(data$data_missing_docu_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_missing_docu_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_missing_docu_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_missing_docu_loc___4.factor)=c("Unchecked","Checked")
levels(data$methods_data_mining_and_cleaning_complete.factor)=c("Incomplete","Unverified","Complete")
levels(data$analysis_code_shared.factor)=c("Yes","No")
levels(data$results_verifiable.factor)=c("No","Yes","NA")
levels(data$results_linked_to_code.factor)=c("Yes","No")
levels(data$analysis_script_commented.factor)=c("Yes","No")
levels(data$analysis_processes_clear.factor)=c("Yes","No")
levels(data$data_analysis_doc_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_analysis_doc_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_analysis_doc_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_analysis_doc_loc___4.factor)=c("Unchecked","Checked")
levels(data$software_analysis_code.factor)=c("Yes","No")
levels(data$analysis_software_open___1.factor)=c("Unchecked","Checked")
levels(data$analysis_software_open___2.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___1.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___2.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___3.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___4.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___5.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___6.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___7.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___8.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___9.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___10.factor)=c("Unchecked","Checked")
levels(data$analysis_code_shared_loc___11.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___1.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___2.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___3.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___4.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___5.factor)=c("Unchecked","Checked")
levels(data$analysis_request_restrict___6.factor)=c("Unchecked","Checked")
levels(data$methods_data_analysis_complete.factor)=c("Incomplete","Unverified","Complete")
levels(data$final_dataset_shared.factor)=c("Yes","No")
levels(data$final_dataset_shared_loc___1.factor)=c("Unchecked","Checked")
levels(data$final_dataset_shared_loc___2.factor)=c("Unchecked","Checked")
levels(data$final_dataset_shared_loc___3.factor)=c("Unchecked","Checked")
levels(data$final_dataset_shared_loc___4.factor)=c("Unchecked","Checked")
levels(data$final_dataset_shared_loc___5.factor)=c("Unchecked","Checked")
levels(data$final_dataset_shared_loc___6.factor)=c("Unchecked","Checked")
levels(data$data_requesting_process.factor)=c("Yes","No")
levels(data$data_req_doc_loc___1.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___2.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___3.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___4.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___5.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___6.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___7.factor)=c("Unchecked","Checked")
levels(data$data_req_doc_loc___8.factor)=c("Unchecked","Checked")
levels(data$journal_datasharing_policy.factor)=c("Yes","No","Unclear")
levels(data$data_req_access.factor)=c("Closed","Restricted departmental database","Restricted to within authors institution or practice","Restricted access requiring data request and IRB","Restricted access requiring data request","Open to public","Other","Unclear")
levels(data$data_req_charge.factor)=c("Yes","No","Not stated","Unclear")
levels(data$readme_file_shared.factor)=c("Yes","No")
levels(data$rm_clear_contents.factor)=c("Yes","No")
levels(data$rm_metadata_standard.factor)=c("Yes","No")
levels(data$rm_filing_naming_convention.factor)=c("Yes","No")
levels(data$rm_index.factor)=c("Yes","No")
levels(data$rm_inventory.factor)=c("Yes","No")
levels(data$rm_license_rights.factor)=c("Yes","No")
levels(data$rm_abstract_proj_descr.factor)=c("Yes","No")
levels(data$rm_creation_dates.factor)=c("Yes","No")
levels(data$rm_ref_pub_supplementary.factor)=c("Yes","No")
levels(data$rm_operating_systems.factor)=c("Yes","No")
levels(data$rm_sw_version_numbers.factor)=c("Yes","No")
levels(data$rm_limitations.factor)=c("Yes","No")
levels(data$limitations_where___1.factor)=c("Unchecked","Checked")
levels(data$limitations_where___2.factor)=c("Unchecked","Checked")
levels(data$limitations_where___3.factor)=c("Unchecked","Checked")
levels(data$limitations_where___4.factor)=c("Unchecked","Checked")
levels(data$limitations_where___5.factor)=c("Unchecked","Checked")
levels(data$limitations_where___6.factor)=c("Unchecked","Checked")
levels(data$limitations_where___7.factor)=c("Unchecked","Checked")
levels(data$limitations_where___8.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_shared.factor)=c("Yes","No")
levels(data$data_dictionary_location___1.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___2.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___3.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___4.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___5.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___6.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___7.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___8.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___9.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___10.factor)=c("Unchecked","Checked")
levels(data$data_dictionary_location___11.factor)=c("Unchecked","Checked")
levels(data$dd_variables_intelligble.factor)=c("Yes","No")
levels(data$dd_abbreviations_limited.factor)=c("Yes","No")
levels(data$dd_abbreviations_defined.factor)=c("Yes","No")
levels(data$dd_truncated_variables.factor)=c("Yes","No")
levels(data$dd_coded_var_labels.factor)=c("Yes","No")
levels(data$central_data_request.factor)=c("Yes","No")
levels(data$data_assigned_obj_identifiers.factor)=c("Yes","No")
levels(data$data_discoverability_tags.factor)=c("Yes","No")
levels(data$data_sharing_and_data_documentation_complete.factor)=c("Incomplete,","Unverified","Complete")

#keep only sean, christian , and Rosalia



library(tidyr)
library(dplyr)
# keep only reviewers of relevance
data2 <- data[data$reviewer %in% c(5, 6, 8), ]

# keep only radio buttons, article doi, reviewer, and Yes/NO questions

#updated 11/1/2016
df <- subset(data2, select = c(4, 15:19, 25, 30:32, 54:58, 77:81, 100:104, 123:128, 131, 136, 161:163, 175, 180, 182, 187, 192:193, 198, 205:209, 214, 240, 248, 258, 260, 262:275,  284, 296:303))
#create a variable called reviewer class where we have reviewer 5 vs other reviewers
df$reviewer_class <- ifelse(data2$reviewer == 5,
                               c("Sean"), c("Other"))
# get the count of each article doi and filter to only those with 2 observations
doi_with_two <- group_by(df, article_doi) %>% summarise(n_each_doi = n()) %>% filter(n_each_doi == 2)
# inner join with the df set
df_with_two <- inner_join(df, doi_with_two)
#delete the unnecessary count variable
df_with_two$n_each_doi <- NULL
#reshape the data
df_t <-reshape (df_with_two, idvar= "article_doi", timevar = "reviewer_class", direction = "wide")

library(gmodels)
#Freq tables
# if it's quoted out then the variable exists in the dataset still but all the values are missing
CrossTable(df_with_two$reviewer_class,df_with_two$primary_research,  fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$meta_analysis, chisq =TRUE)

CrossTable(df_with_two$reviewer_class,df_with_two$reproducibilityresearch_yn,  fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$hypothesis_gen_or_driv,  fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$clear_hypothesis,  fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$query_method_stated, chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$query_script_shared,  chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$database_cited,  fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_script_comments_1,  fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_doc_open_db_1)
CrossTable(df_with_two$reviewer_class,df_with_two$db_metadata_1, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$restriction_db_1, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$db_charge_1, fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_script_comments_2)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_doc_open_db_2)
CrossTable(df_with_two$reviewer_class,df_with_two$db_metadata_2, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$db_2_restriction, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$db_charge_2, fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_script_comments_3)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_doc_open_db_3)
CrossTable(df_with_two$reviewer_class,df_with_two$db_metadata_3)

CrossTable(df_with_two$reviewer_class,df_with_two$db_3_restriction, fisher = TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$db_charge_3)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_script_comments_4)
#CrossTable(df_with_two$reviewer_class,df_with_two$query_doc_open_db_4)
CrossTable(df_with_two$reviewer_class,df_with_two$db_metadata_4)
CrossTable(df_with_two$reviewer_class,df_with_two$db_4_restriction)
#CrossTable(df_with_two$reviewer_class,df_with_two$db_charge_4)
CrossTable(df_with_two$reviewer_class,df_with_two$query_missing_reason, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$inclusion_and_exclusion_stated, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$ontol_and_vocab_stated, chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$text_nlp_yn, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$text_mining_preprocess, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$nlp_validation, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$nlp_interoperable)
CrossTable(df_with_two$reviewer_class,df_with_two$data_cleaned_yn, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$data_merged_yn, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$data_merge_id, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$messy_variables_process, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$analysis_code_shared, chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$text_mine_source, fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$results_linked_to_code)
#CrossTable(df_with_two$reviewer_class,df_with_two$analysis_script_commented)
CrossTable(df_with_two$reviewer_class,df_with_two$analysis_processes_clear,fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$software_analysis_code, chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$final_dataset_shared,chisq=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$data_requesting_process, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$journal_datasharing_policy, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$data_req_access, fisher=TRUE)
CrossTable(df_with_two$reviewer_class,df_with_two$readme_file_shared, fisher=TRUE)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_clear_contents)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_metadata_standard)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_filing_naming_convention)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_index)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_inventory)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_license_rights)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_abstract_proj_descr)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_creation_dates)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_ref_pub_supplementary)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_operating_systems)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_sw_version_numbers)
#CrossTable(df_with_two$reviewer_class,df_with_two$rm_limitations)
#CrossTable(df_with_two$reviewer_class,df_with_two$dd_variables_intelligble)
#CrossTable(df_with_two$reviewer_class,df_with_two$dd_abbreviations_limited)
#CrossTable(df_with_two$reviewer_class,df_with_two$dd_abbreviations_defined)
#CrossTable(df_with_two$reviewer_class,df_with_two$dd_truncated_variables)
#CrossTable(df_with_two$reviewer_class,df_with_two$dd_coded_var_labels)
#CrossTable(df_with_two$reviewer_class,df_with_two$central_data_request)
#CrossTable(df_with_two$reviewer_class,df_with_two$data_assigned_obj_identifiers)
#CrossTable(df_with_two$reviewer_class,df_with_two$data_discoverability_tags)


#make dataframe for cohen kappa
library('psych')
# only use non NA or 0 variances in cohen kappa (part of cohen kappa rules)
var(df_t$primary_research.Other) #NA
var(df_t$primary_research.Sean) #NA
var(df_t$meta_analysis.Sean) #0

var(df_t$meta_analysis.Other) #0
var(df$reproducibilityresearch_yn) #[1] 0.02499189
var(df_t$reproducibilityresearch_yn.Sean) 
var(df_t$reproducibilityresearch_yn.Other) 
var(df_t$hypothesis_gen_or_driv.Sean) #
var(df_t$hypothesis_gen_or_driv.Other) #0.04993252
var(df_t$clear_hypothesis.Sean) #0.7300945
var(df_t$clear_hypothesis.Other)
var(df_t$state_data_sources.Sean) # 0.09446694
var(df_t$state_data_sources.Other) #NA

#to do cohen kappa var ^= 0 at one of the variables
# Try Sean first
var(df_t$database_cited.Sean) #NA
var(df_t$query_script_shared.Sean)#NA 
var(df_t$query_method_stated.Sean) #NA
var(df_t$query_script_comments_1.Sean) #NA
var(df_t$query_doc_open_db_1.Sean) #NA
var(df_t$db_metadata_1.Sean) #NA
var(df_t$restriction_db_1.Sean) #NA
var(df_t$db_charge_1.Sean) #NA
var(df_t$query_script_comments_2.Sean)#NA 
var(df_t$query_doc_open_db_2.Sean) #NA
var(df_t$db_metadata_2.Sean) #NA
var(df_t$db_2_restriction.Sean) #NA
var(df_t$db_charge_2.Sean) #NA
var(df_t$query_script_comments_3.Sean)#NA 
var(df_t$query_doc_open_db_3.Sean) #NA
var(df_t$db_metadata_3.Sean) #NA
var(df_t$db_3_restriction.Sean) #NA
var(df_t$db_charge_3.Sean) #NA
var(df_t$query_script_comments_4.Sean)#NA 
var(df_t$query_doc_open_db_4.Sean) #NA
var(df_t$db_metadata_4.Sean) #NA
var(df_t$db_4_restriction.Sean) #NA
var(df_t$db_charge_4.Sean) #NA
var(df_t$query_missing_reason.Sean) #NA
var(df_t$inclusion_and_exclusion_stated.Sean)#0.02564103 
var(df_t$ontol_and_vocab_stated.Sean) #NA
var(df_t$text_nlp_yn.Sean) #0.1336032
var(df_t$text_mine_source.Sean)#NA 
var(df_t$text_mining_preprocess.Sean) #NA
var(df_t$nlp_validation.Sean) #0.1821862
var(df_t$nlp_interoperable.Sean) #NA
var(df_t$data_cleaned_yn.Sean) #NA
var(df_t$data_merged_yn.Sean) #0.04993252
var(df_t$data_merge_id.Sean) #0.02564103
var(df_t$messy_variables_process.Sean)#NA 
var(df_t$missing_variables_process.Sean) #0.1147099
var(df_t$analysis_code_shared.Sean) #0
var(df_t$results_verifiable.Sean) #NA
var(df_t$results_linked_to_code.Sean)#NA 
var(df_t$analysis_script_commented.Sean)#NA 
var(df_t$analysis_processes_clear.Sean) #0.04993252
var(df_t$software_analysis_code.Sean) # 0.2361673
var(df_t$final_dataset_shared.Sean) #0
var(df_t$data_requesting_process.Sean) #0.1511471
var(df_t$journal_datasharing_policy.Sean) # 198998.3
var(df_t$data_req_access.Sean) #178989.6
var(df_t$data_req_charge.Sean) #39110.82
var(df_t$readme_file_shared.Sean) #NA
var(df_t$rm_clear_contents.Sean) #NA
var(df_t$rm_metadata_standard.Sean) #NA
var(df_t$rm_filing_naming_convention.Sean) #NA 
var(df_t$rm_index.Sean) #NA
var(df_t$rm_inventory.Sean)#NA 
var(df_t$rm_license_rights.Sean)#NA 
var(df_t$rm_abstract_proj_descr.Sean)#NA 
var(df_t$rm_creation_dates.Sean) #NA
var(df_t$rm_ref_pub_supplementary.Sean)#NA 
var(df_t$rm_operating_systems.Sean) #NA
var(df_t$rm_sw_version_numbers.Sean) #NA
var(df_t$rm_limitations.Sean) #NA
var(df_t$data_dictionary_shared.Sean)#NA 
var(df_t$dd_variables_intelligble.Sean) #NA
var(df_t$dd_abbreviations_limited.Sean) #NA
var(df_t$dd_abbreviations_defined.Sean) #NA
var(df_t$dd_truncated_variables.Sean) #NA
var(df_t$dd_coded_var_labels.Sean) #NA
var(df_t$central_data_request.Sean) #NA
var(df_t$data_assigned_obj_identifiers.Sean)#NA 
var(df_t$data_discoverability_tags.Sean) #NA
# Now do others (that don't already have found variance)
var(df_t$state_data_sources.Other, na.rm = T) #0.2495544
var(df_t$database_cited.Other) #NA
var(df_t$query_script_shared.Other)#NA 
var(df_t$query_method_stated.Other) #NA
var(df_t$query_script_comments_1.Other) #NA
var(df_t$query_doc_open_db_1.Other) #NA
var(df_t$db_metadata_1.Other) #NA
var(df_t$restriction_db_1.Other) #NA
var(df_t$db_charge_1.Other) #NA
var(df_t$db_charge_1.Other, na.rm=T) #0
var(df_t$query_script_comments_2.Other)#NA 
var(df_t$query_doc_open_db_2.Other) #NA
var(df_t$db_metadata_2.Other) #NA
var(df_t$db_2_restriction.Other) #NA

var(df_t$text_nlp_yn.Other, na.rm = T) #0.1069519
var(df_t$nlp_validation.Other, na.rm = T) #0.06878307
var(df_t$missing_variables_process.Other, na.rm = T) #0.2155797
var(df_t$db_charge_2.Other) #NA
var(df_t$query_script_comments_3.Other)#NA 
var(df_t$query_doc_open_db_3.Other) #NA
var(df_t$db_metadata_3.Other) #NA
var(df_t$db_3_restriction.Other) #NA
var(df_t$db_charge_3.Other) #NA
var(df_t$query_script_comments_4.Other)#NA 
var(df_t$query_doc_open_db_4.Other) #NA
var(df_t$db_metadata_4.Other) #NA
var(df_t$db_4_restriction.Other) #NA
var(df_t$db_charge_4.Other) #NA
var(df_t$query_missing_reason.Other) #NA
var(df_t$ontol_and_vocab_stated.Other) #NA
var(df_t$text_mine_source.Other)#NA 
var(df_t$text_mining_preprocess.Other) #NA
var(df_t$nlp_interoperable.Other) #NA
var(df_t$data_cleaned_yn.Other) #NA
var(df_t$messy_variables_process.Other)#NA 
var(df_t$analysis_processes_clear.Other, na.rm = T) #0.2433155
var(df_t$analysis_code_shared.Other) #0
var(df_t$results_verifiable.Other) #NA
var(df_t$results_linked_to_code.Other)#NA 
var(df_t$analysis_script_commented.Other)#NA 
var(df_t$final_dataset_shared.Other) #0
var(df_t$readme_file_shared.Other) #NA
var(df_t$rm_clear_contents.Other) #NA
var(df_t$rm_metadata_standard.Other) #NA
var(df_t$rm_filing_naming_convention.Other) #NA 
var(df_t$rm_index.Other) #NA
var(df_t$rm_inventory.Other)#NA 
var(df_t$rm_license_rights.Other)#NA 
var(df_t$rm_abstract_proj_descr.Other)#NA 
var(df_t$rm_creation_dates.Other) #NA
var(df_t$rm_ref_pub_supplementary.Other)#NA 
var(df_t$rm_operating_systems.Other) #NA
var(df_t$rm_sw_version_numbers.Other) #NA
var(df_t$rm_limitations.Other) #NA
var(df_t$data_dictionary_shared.Other)#NA 
var(df_t$dd_variables_intelligble.Other) #NA
var(df_t$dd_abbreviations_limited.Other) #NA
var(df_t$dd_abbreviations_defined.Other) #NA
var(df_t$dd_truncated_variables.Other) #NA
var(df_t$dd_coded_var_labels.Other) #NA
var(df_t$central_data_request.Other) #NA
var(df_t$data_assigned_obj_identifiers.Other)#NA 
var(df_t$data_discoverability_tags.Other) #NA

# variables for Cohen KAPPA :
cohen.kappa(cbind(df_t$hypothesis_gen_or_driv.Sean, df_t$hypothesis_gen_or_driv.Other), alpha=0.05)

cohen.kappa(cbind(df_t$reproducibilityresearch_yn.Sean, df_t$reproducibilityresearch_yn.Other), alpha=0.05)
cohen.kappa(cbind(df_t$clear_hypothesis.Sean, df_t$clear_hypothesis.Other), alpha=0.05)
cohen.kappa(cbind(df_t$state_data_sources.Sean, df_t$state_data_sources.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$inclusion_and_exclusion_stated.Sean, df_t$inclusion_and_exclusion_stated.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$text_nlp_yn.Sean, df_t$text_nlp_yn.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$nlp_validation.Sean, df_t$nlp_validation.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$data_merged_yn.Sean, df_t$data_merged_yn.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$data_merge_id.Sean, df_t$data_merge_id.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$missing_variables_process.Sean, df_t$missing_variables_process.Other), alpha=0.05)  
#cohen.kappa(cbind(df_t$results_verifiable.Sean, df_t$results_verifiable.Other), alpha=0.05)  
#cohen.kappa(cbind(df_t$results_linked_to_code.Sean, df_t$results_linked_to_code.Other), alpha=0.05)  
#cohen.kappa(cbind(df_t$analysis_script_commented.Sean, df_t$analysis_script_commented.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$analysis_processes_clear.Sean, df_t$analysis_processes_clear.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$software_analysis_code.Sean, df_t$software_analysis_code.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$data_requesting_process.Sean, df_t$data_requesting_process.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$journal_datasharing_policy.Sean, df_t$journal_datasharing_policy.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$data_req_access.Sean, df_t$data_req_access.Other), alpha=0.05)  
cohen.kappa(cbind(df_t$data_req_charge.Sean, df_t$data_req_charge.Other), alpha=0.05)  

ds_hypothesis_gen <- df_t$hypothesis_gen_or_driv.Sean - df_t$hypothesis_gen_or_driv.Other
no_zero_hypothesis_gen <- sum(ds_hypothesis_gen == 0, na.rm = TRUE)
no_hypothesis_gen <-length(ds_hypothesis_gen[!is.na(ds_hypothesis_gen)])
pa_hypothesis_gen <- (no_zero_hypothesis_gen/no_hypothesis_gen)*100
pa_hypothesis_gen
ds_reproducibilityresearch_yn <- df_t$reproducibilityresearch_yn.Sean - df_t$reproducibilityresearch_yn.Other
no_zero_reproducibilityresearch_yn <- sum(ds_reproducibilityresearch_yn == 0, na.rm = TRUE)
no_reproducibilityresearch_yn <-length(ds_reproducibilityresearch_yn[!is.na(ds_reproducibilityresearch_yn)])
pa_reproducibilityresearch_yn <- (no_zero_reproducibilityresearch_yn/no_reproducibilityresearch_yn)*100
pa_reproducibilityresearch_yn

ds_clear_hypothesis <- df_t$clear_hypothesis.Sean - df_t$clear_hypothesis.Other
no_zero_clear_hypothesis <- sum(ds_clear_hypothesis == 0, na.rm = TRUE)
no_clear_hypothesis <-length(ds_clear_hypothesis[!is.na(ds_clear_hypothesis)])
pa_clear_hypothesis <- (no_zero_clear_hypothesis/no_clear_hypothesis)*100
pa_clear_hypothesis

ds_state_data_sources <- df_t$state_data_sources.Sean - df_t$state_data_sources.Other
no_zero_state_data_sources<- sum(ds_state_data_sources == 0, na.rm = TRUE)
no_state_data_sources <-length(ds_state_data_sources[!is.na(ds_state_data_sources)])
pa_state_data_sources<- (no_zero_state_data_sources/no_state_data_sources)*100
pa_state_data_sources

ds_inclusion_and_exclusion_stated <- df_t$inclusion_and_exclusion_stated.Sean - df_t$inclusion_and_exclusion_stated.Other
no_zero_inclusion_and_exclusion_stated<- sum(ds_inclusion_and_exclusion_stated == 0, na.rm = TRUE)
no_inclusion_and_exclusion_stated <-length(ds_inclusion_and_exclusion_stated[!is.na(ds_inclusion_and_exclusion_stated)])
pa_inclusion_and_exclusion_stated <- (no_zero_inclusion_and_exclusion_stated/no_inclusion_and_exclusion_stated)*100
pa_inclusion_and_exclusion_stated

ds_text_nlp_yn <- df_t$text_nlp_yn.Sean - df_t$text_nlp_yn.Other
no_zero_text_nlp_yn <- sum(ds_text_nlp_yn == 0, na.rm = TRUE)
no_text_nlp_yn <-length(ds_text_nlp_yn[!is.na(ds_text_nlp_yn)])
pa_text_nlp_yn <- (no_zero_text_nlp_yn/no_text_nlp_yn)*100
pa_text_nlp_yn

ds_nlp_validation <- df_t$nlp_validation.Sean - df_t$nlp_validation.Other
no_zero_nlp_validation <- sum(ds_nlp_validation == 0, na.rm = TRUE)
no_nlp_validation <-length(ds_nlp_validation[!is.na(ds_nlp_validation)])
pa_nlp_validation <- (no_zero_nlp_validation/no_nlp_validation)*100
pa_nlp_validation

ds_data_merged_yn <- df_t$data_merged_yn.Sean - df_t$data_merged_yn.Other
no_zero_data_merged_yn <- sum(ds_data_merged_yn == 0, na.rm = TRUE)
no_data_merged_yn <-length(ds_data_merged_yn[!is.na(ds_data_merged_yn)])
pa_data_merged_yn <- (no_zero_data_merged_yn/no_data_merged_yn)*100
pa_data_merged_yn
ds_data_merge_id <- df_t$data_merge_id.Sean - df_t$data_merge_id.Other
no_zero_data_merge_id<- sum(ds_data_merge_id == 0, na.rm = TRUE)
no_data_merge_id <-length(ds_data_merge_id[!is.na(ds_data_merge_id)])
pa_data_merge_id <- (no_zero_data_merge_id/no_data_merge_id)*100
pa_data_merge_id
ds_missing_variables_process <- df_t$missing_variables_process.Sean - df_t$missing_variables_process.Other
no_zero_missing_variables_process<- sum(ds_missing_variables_process == 0, na.rm = TRUE)
no_missing_variables_process <-length(ds_missing_variables_process[!is.na(ds_missing_variables_process)])
pa_missing_variables_process <- (no_zero_missing_variables_process/no_missing_variables_process)*100
pa_missing_variables_process
# % a
ds_analysis_processes_clear <- df_t$analysis_processes_clear.Sean - df_t$analysis_processes_clear.Other
no_zero_analysis_processes_clear<- sum(ds_analysis_processes_clear == 0, na.rm = TRUE)
no_analysis_processes_clear <-length(ds_analysis_processes_clear[!is.na(ds_analysis_processes_clear)])
pa_analysis_processes_clear<- (no_zero_analysis_processes_clear/no_analysis_processes_clear)*100
pa_analysis_processes_clear

ds_software_analysis_code <- df_t$software_analysis_code.Sean - df_t$software_analysis_code.Other
no_zero_software_analysis_code<- sum(ds_software_analysis_code == 0, na.rm = TRUE)
no_software_analysis_code <-length(ds_software_analysis_code[!is.na(ds_software_analysis_code)])
pa_software_analysis_code <- (no_zero_software_analysis_code/no_software_analysis_code)*100
pa_software_analysis_code

ds_data_requesting_process <- df_t$data_requesting_process.Sean - df_t$data_requesting_process.Other
no_zero_data_requesting_process<- sum(ds_data_requesting_process == 0, na.rm = TRUE)
no_data_requesting_process <-length(ds_data_requesting_process[!is.na(ds_data_requesting_process)])
pa_data_requesting_process <- (no_zero_data_requesting_process/no_data_requesting_process)*100
pa_data_requesting_process

ds_journal_datasharing_policy <- df_t$journal_datasharing_policy.Sean - df_t$journal_datasharing_policy.Other
no_zero_journal_datasharing_policy<- sum(ds_journal_datasharing_policy == 0, na.rm = TRUE)
no_journal_datasharing_policy <-length(ds_journal_datasharing_policy[!is.na(ds_journal_datasharing_policy)])
pa_journal_datasharing_policy <- (no_zero_journal_datasharing_policy/no_journal_datasharing_policy)*100
pa_journal_datasharing_policy

ds_data_req_access <- df_t$data_req_access.Sean - df_t$data_req_access.Other
no_zero_data_req_access<- sum(ds_data_req_access == 0, na.rm = TRUE)
no_data_req_access <-length(ds_data_req_access[!is.na(ds_data_req_access)])
pa_data_req_access <- (no_zero_data_req_access/no_data_req_access)*100
pa_data_req_access

ds_data_req_charge <- df_t$data_req_charge.Sean - df_t$data_req_charge.Other
no_zero_data_req_charge<- sum(ds_data_req_charge == 0, na.rm = TRUE)
no_data_req_charge <-length(ds_data_req_charge[!is.na(ds_data_req_charge)])
pa_data_req_charge <- (no_zero_data_req_charge/no_data_req_charge)*100
pa_data_req_charge

# % agreement done for those who can't use Cohen Kappa
ds_primary_research <- df_t$primary_research.Sean - df_t$primary_research.Other
no_zero_primary_research <- sum(ds_primary_research == 0, na.rm = TRUE)
no_primary_research <-length(ds_primary_research[!is.na(ds_primary_research)])
pa_primary_research <- (no_zero_primary_research/no_primary_research)*100
pa_primary_research



ds_meta_analysis <- df_t$meta_analysis.Sean - df_t$meta_analysis.Other
no_zero_meta_analysis <- sum(ds_meta_analysis == 0, na.rm = TRUE)
no_meta_analysis <-length(ds_meta_analysis[!is.na(ds_meta_analysis)])
pa_meta_analysis <- (no_zero_meta_analysis/no_meta_analysis)*100
pa_meta_analysis
#100%


ds_database_cited <- df_t$database_cited.Sean - df_t$database_cited.Other
no_zero_database_cited <- sum(ds_database_cited == 0, na.rm = TRUE)
no_database_cited <-length(ds_database_cited[!is.na(ds_database_cited)])
pa_database_cited <- (no_zero_database_cited/no_database_cited)*100
pa_database_cited

ds_query_script_shared <- df_t$query_script_shared.Sean - df_t$query_script_shared.Other
no_zero_query_script_shared <- sum(ds_query_script_shared == 0, na.rm = TRUE)
no_query_script_shared <-length(ds_query_script_shared[!is.na(ds_query_script_shared)])
pa_query_script_shared <- (no_zero_query_script_shared/no_query_script_shared)*100
pa_query_script_shared
#100%
ds_query_method_stated<- df_t$query_method_stated.Sean - df_t$query_method_stated.Other
no_zero_query_method_stated<- sum(ds_query_method_stated== 0, na.rm = TRUE)
no_query_method_stated<-length(ds_query_method_stated[!is.na(ds_query_method_stated)])
pa_query_method_stated<- (no_zero_query_method_stated/no_query_method_stated)*100
pa_query_method_stated

ds_query_script_comments_1<- df_t$query_script_comments_1.Sean - df_t$query_script_comments_1.Other
no_zero_query_script_comments_1<- sum(ds_query_script_comments_1== 0, na.rm = TRUE)
no_query_script_comments_1<-length(ds_query_script_comments_1[!is.na(ds_query_script_comments_1)])
pa_query_script_comments_1<- (no_zero_query_script_comments_1/no_query_script_comments_1)*100
pa_query_script_comments_1
# all missing values
ds_query_doc_open_db_1 <- df_t$query_doc_open_db_1.Sean - df_t$query_doc_open_db_1.Other
no_zero_query_doc_open_db_1 <- sum(ds_query_doc_open_db_1 == 0, na.rm = TRUE)
no_query_doc_open_db_1 <-length(ds_query_doc_open_db_1 [!is.na(ds_query_doc_open_db_1 )])
pa_query_doc_open_db_1 <- (no_zero_query_doc_open_db_1 /no_query_doc_open_db_1 )*100
pa_query_doc_open_db_1 
# all missing values
ds_db_metadata_1<- df_t$db_metadata_1.Sean - df_t$db_metadata_1.Other
no_zero_db_metadata_1<- sum(ds_db_metadata_1== 0, na.rm = TRUE)
no_db_metadata_1<-length(ds_db_metadata_1[!is.na(ds_db_metadata_1)])
pa_db_metadata_1<- (no_zero_db_metadata_1/no_db_metadata_1)*100
pa_db_metadata_1
#100%
ds_restriction_db_1<- df_t$restriction_db_1.Sean - df_t$restriction_db_1.Other
no_zero_restriction_db_1<- sum(ds_restriction_db_1== 0, na.rm = TRUE)
no_restriction_db_1<-length(ds_restriction_db_1[!is.na(ds_restriction_db_1)])
pa_restriction_db_1<- (no_zero_restriction_db_1/no_restriction_db_1)*100
pa_restriction_db_1
#50%
ds_db_charge_1<- df_t$db_charge_1.Sean - df_t$db_charge_1.Other
no_zero_db_charge_1<- sum(ds_db_charge_1== 0, na.rm = TRUE)
no_db_charge_1<-length(ds_db_charge_1[!is.na(ds_db_charge_1)])
pa_db_charge_1<- (no_zero_db_charge_1/no_db_charge_1)*100
pa_db_charge_1
# one has all missing values
ds_query_script_comments_2<- df_t$query_script_comments_2.Sean - df_t$query_script_comments_2.Other
no_zero_query_script_comments_2<- sum(ds_query_script_comments_2== 0, na.rm = TRUE)
no_query_script_comments_2<-length(ds_query_script_comments_2[!is.na(ds_query_script_comments_2)])
pa_query_script_comments_2<- (no_zero_query_script_comments_2/no_query_script_comments_2)*100
pa_query_script_comments_2
#all missing values
ds_query_doc_open_db_2<- df_t$query_doc_open_db_2.Sean - df_t$query_doc_open_db_2.Other
no_zero_query_doc_open_db_2<- sum(ds_query_doc_open_db_2== 0, na.rm = TRUE)
no_query_doc_open_db_2<-length(ds_query_doc_open_db_2[!is.na(ds_query_doc_open_db_2)])
pa_query_doc_open_db_2<- (no_zero_query_doc_open_db_2/no_query_doc_open_db_2)*100
pa_query_doc_open_db_2
#all missing values
ds_db_metadata_2<- df_t$db_metadata_2.Sean - df_t$db_metadata_2.Other
no_zero_db_metadata_2<- sum(ds_db_metadata_2== 0, na.rm = TRUE)
no_db_metadata_2<-length(ds_db_metadata_2[!is.na(ds_db_metadata_2)])
pa_db_metadata_2<- (no_zero_db_metadata_2/no_db_metadata_2)*100
pa_db_metadata_2
#100%
ds_db_2_restriction<- df_t$db_2_restriction.Sean - df_t$db_2_restriction.Other
no_zero_db_2_restriction<- sum(ds_db_2_restriction== 0, na.rm = TRUE)
no_db_2_restriction<-length(ds_db_2_restriction[!is.na(ds_db_2_restriction)])
pa_db_2_restriction<- (no_zero_db_2_restriction/no_db_2_restriction)*100
pa_db_2_restriction
#
ds_db_charge_2<- df_t$db_charge_2.Sean - df_t$db_charge_2.Other
no_zero_db_charge_2<- sum(ds_db_charge_2== 0, na.rm = TRUE)
no_db_charge_2<-length(ds_db_charge_2[!is.na(ds_db_charge_2)])
pa_db_charge_2<- (no_zero_db_charge_2/no_db_charge_2)*100
pa_db_charge_2
#100%
ds_query_script_comments_3<- df_t$query_script_comments_3.Sean - df_t$query_script_comments_3.Other
no_zero_query_script_comments_3<- sum(ds_query_script_comments_3== 0, na.rm = TRUE)
no_query_script_comments_3<-length(ds_query_script_comments_3[!is.na(ds_query_script_comments_3)])
pa_query_script_comments_3<- (no_zero_query_script_comments_3/no_query_script_comments_3)*100
pa_query_script_comments_3
#all missing values

ds_query_doc_open_db_3<- df_t$query_doc_open_db_3.Sean - df_t$query_doc_open_db_3.Other
no_zero_query_doc_open_db_3<- sum(ds_query_doc_open_db_3== 0, na.rm = TRUE)
no_query_doc_open_db_3<-length(ds_query_doc_open_db_3[!is.na(ds_query_doc_open_db_3)])
pa_query_doc_open_db_3<- (no_zero_query_doc_open_db_3/no_query_doc_open_db_3)*100
pa_query_doc_open_db_3
#all missing values
ds_db_metadata_3<- df_t$db_metadata_3.Sean - df_t$db_metadata_3.Other
no_zero_db_metadata_3<- sum(ds_db_metadata_3== 0, na.rm = TRUE)
no_db_metadata_3<-length(ds_db_metadata_3[!is.na(ds_db_metadata_3)])
pa_db_metadata_3<- (no_zero_db_metadata_3/no_db_metadata_3)*100
pa_db_metadata_3
#100%
ds_db_3_restriction<- df_t$db_3_restriction.Sean - df_t$db_3_restriction.Other
no_zero_db_3_restriction<- sum(ds_db_3_restriction== 0, na.rm = TRUE)
no_db_3_restriction<-length(ds_db_3_restriction[!is.na(ds_db_3_restriction)])
pa_db_3_restriction<- (no_zero_db_3_restriction/no_db_3_restriction)*100
pa_db_3_restriction
#100
ds_db_charge_3<- df_t$db_charge_3.Sean - df_t$db_charge_3.Other
no_zero_db_charge_3<- sum(ds_db_charge_3== 0, na.rm = TRUE)
no_db_charge_3<-length(ds_db_charge_3 [!is.na(ds_db_charge_3)])
pa_db_charge_3<- (no_zero_db_charge_3/no_db_charge_3)*100
pa_db_charge_3
#100
ds_query_script_comments_4<- df_t$query_script_comments_4.Sean - df_t$query_script_comments_4.Other
no_zero_query_script_comments_4<- sum(ds_query_script_comments_4== 0, na.rm = TRUE)
no_query_script_comments_4 <- length(ds_query_script_comments_4 [!is.na(ds_query_script_comments_4)])
pa_query_script_comments_4<-  (no_zero_query_script_comments_4/no_query_script_comments_4)*100
pa_query_script_comments_4
#all missing values
ds_query_doc_open_db_4 <- df_t$query_doc_open_db_4.Sean - df_t$query_doc_open_db_4.Other
no_zero_query_doc_open_db_4 <- sum(ds_query_doc_open_db_4 == 0, na.rm = TRUE)
no_query_doc_open_db_4 <-length(ds_query_doc_open_db_4[!is.na(ds_query_doc_open_db_4)])
pa_query_doc_open_db_4 <- (no_zero_query_doc_open_db_4/no_query_doc_open_db_4)*100
pa_query_doc_open_db_4
#all missing
ds_db_metadata_4 <- df_t$db_metadata_4.Sean - df_t$db_metadata_4.Other
no_zero_db_metadata_4 <- sum(ds_db_metadata_4 == 0, na.rm = TRUE)
no_db_metadata_4 <-length(ds_db_metadata_4[!is.na(ds_db_metadata_4)])
pa_db_metadata_4 <- (no_zero_db_metadata_4/no_db_metadata_4)*100
pa_db_metadata_4
#all missing
ds_db_4_restriction <- df_t$db_4_restriction.Sean - df_t$db_4_restriction.Other
no_zero_db_4_restriction <- sum(ds_db_4_restriction == 0, na.rm = TRUE)
no_db_4_restriction <-length(ds_db_4_restriction[!is.na(ds_db_4_restriction)])
pa_db_4_restriction <- (no_zero_db_4_restriction/no_db_4_restriction)*100
pa_db_4_restriction
#all missing values
ds_db_charge_4 <- df_t$db_charge_4.Sean - df_t$db_charge_4.Other
no_zero_db_charge_4 <- sum(ds_db_charge_4 == 0, na.rm = TRUE)
no_db_charge_4 <-length(ds_db_charge_4[!is.na(ds_db_charge_4)])
pa_db_charge_4 <- (no_zero_db_charge_4/no_db_charge_4)*100
pa_db_charge_4
#all missing
ds_query_missing_reason <- df_t$query_missing_reason.Sean - df_t$query_missing_reason.Other
no_zero_query_missing_reason <- sum(ds_query_missing_reason == 0, na.rm = TRUE)
no_query_missing_reason <-length(ds_query_missing_reason[!is.na(ds_query_missing_reason)])
pa_query_missing_reason <- (no_zero_query_missing_reason/no_query_missing_reason)*100
pa_query_missing_reason

ds_ontol_and_vocab_stated <- df_t$ontol_and_vocab_stated.Sean - df_t$ontol_and_vocab_stated.Other
no_zero_ontol_and_vocab_stated <- sum(ds_ontol_and_vocab_stated == 0, na.rm = TRUE)
no_ontol_and_vocab_stated <-length(ds_ontol_and_vocab_stated[!is.na(ds_ontol_and_vocab_stated)])
pa_ontol_and_vocab_stated <- (no_zero_ontol_and_vocab_stated/no_ontol_and_vocab_stated)*100
pa_ontol_and_vocab_stated
#
ds_text_mine_source <- df_t$text_mine_source.Sean - df_t$text_mine_source.Other
no_zero_text_mine_source <- sum(ds_text_mine_source == 0, na.rm = TRUE)
no_text_mine_source <-length(ds_text_mine_source[!is.na(ds_text_mine_source)])
pa_text_mine_source <- (no_zero_text_mine_source/no_text_mine_source)*100
pa_text_mine_source
#100%
ds_text_mining_preprocess <- df_t$text_mining_preprocess.Sean - df_t$text_mining_preprocess.Other
no_zero_text_mining_preprocess <- sum(ds_text_mining_preprocess == 0, na.rm = TRUE)
no_text_mining_preprocess <-length(ds_text_mining_preprocess[!is.na(ds_text_mining_preprocess)])
pa_text_mining_preprocess <- (no_zero_text_mining_preprocess/no_text_mining_preprocess)*100
pa_text_mining_preprocess

ds_nlp_interoperable <- df_t$nlp_interoperable.Sean - df_t$nlp_interoperable.Other
no_zero_nlp_interoperable <- sum(ds_nlp_interoperable == 0, na.rm = TRUE)
no_nlp_interoperable <-length(ds_nlp_interoperable[!is.na(ds_nlp_interoperable)])
pa_nlp_interoperable <- (no_zero_nlp_interoperable/no_nlp_interoperable)*100
pa_nlp_interoperable
# 100%
ds_data_cleaned_yn<- df_t$data_cleaned_yn.Sean - df_t$data_cleaned_yn.Other
no_zero_data_cleaned_yn <- sum(ds_data_cleaned_yn == 0, na.rm = TRUE)
no_data_cleaned_yn <-length(ds_data_cleaned_yn[!is.na(ds_data_cleaned_yn)])
pa_data_cleaned_yn <- (no_zero_data_cleaned_yn/no_data_cleaned_yn)*100
pa_data_cleaned_yn

ds_messy_variables_process <- df_t$messy_variables_process.Sean - df_t$messy_variables_process.Other
no_zero_messy_variables_process <- sum(ds_messy_variables_process == 0, na.rm = TRUE)
no_messy_variables_process<-length(ds_messy_variables_process[!is.na(ds_messy_variables_process)])
pa_messy_variables_process <- (no_zero_messy_variables_process/no_messy_variables_process)*100
pa_messy_variables_process
#100%
ds_analysis_code_shared <- df_t$analysis_code_shared.Sean - df_t$analysis_code_shared.Other
no_zero_analysis_code_shared <- sum(ds_analysis_code_shared == 0, na.rm = TRUE)
no_analysis_code_shared <-length(ds_analysis_code_shared[!is.na(ds_analysis_code_shared)])
pa_analysis_code_shared <- (no_zero_analysis_code_shared/no_analysis_code_shared)*100
pa_analysis_code_shared
#100%
ds_results_verifiable <- df_t$results_verifiable.Sean - df_t$results_verifiable.Other
no_zero_results_verifiable  <- sum(ds_results_verifiable == 0, na.rm = TRUE)
no_results_verifiable <-length(ds_results_verifiable[!is.na(ds_results_verifiable)])
pa_results_verifiable <- (no_zero_results_verifiable/no_results_verifiable)*100
pa_results_verifiable
#all missing
ds_results_linked_to_code <- df_t$results_linked_to_code.Sean - df_t$results_linked_to_code.Other
no_zero_results_linked_to_code <- sum(ds_results_linked_to_code == 0, na.rm = TRUE)
no_results_linked_to_code <-length(ds_results_linked_to_code[!is.na(ds_results_linked_to_code)])
pa_results_linked_to_code <- (no_zero_results_linked_to_code/no_results_linked_to_code)*100
pa_results_linked_to_code
#missing values
ds_analysis_script_commented <- df_t$analysis_script_commented.Sean - df_t$analysis_script_commented.Other
no_zero_analysis_script_commented <- sum(ds_analysis_script_commented == 0, na.rm = TRUE)
no_analysis_script_commented <-length(ds_analysis_script_commented[!is.na(ds_analysis_script_commented)])
pa_analysis_script_commented <- (no_zero_analysis_script_commented/no_analysis_script_commented)*100
pa_analysis_script_commented
#missing values
ds_final_dataset_shared <- df_t$final_dataset_shared.Sean - df_t$final_dataset_shared.Other
no_zero_final_dataset_shared <- sum(ds_final_dataset_shared == 0, na.rm = TRUE)
no_final_dataset_shared <-length(ds_final_dataset_shared[!is.na(ds_final_dataset_shared)])
pa_final_dataset_shared <- (no_zero_final_dataset_shared/no_final_dataset_shared)*100
pa_final_dataset_shared
#100%
ds_data_req_charge <- df_t$data_req_charge.Sean - df_t$data_req_charge.Other
no_zero_data_req_charge <- sum(ds_data_req_charge == 0, na.rm = TRUE)
no_data_req_charge <-length(ds_data_req_charge[!is.na(ds_data_req_charge)])
pa_data_req_charge <- (no_zero_data_req_charge/no_data_req_charge)*100
pa_data_req_charge

ds_readme_file_shared <- df_t$readme_file_shared.Sean - df_t$readme_file_shared.Other
no_zero_readme_file_shared <- sum(ds_readme_file_shared == 0, na.rm = TRUE)
no_readme_file_shared <-length(ds_readme_file_shared[!is.na(ds_readme_file_shared)])
pa_readme_file_shared <- (no_zero_readme_file_shared/no_readme_file_shared)*100
pa_readme_file_shared
#100%
ds_rm_clear_contents <- df_t$rm_clear_contents.Sean - df_t$rm_clear_contents.Other
no_zero_rm_clear_contents <- sum(ds_rm_clear_contents == 0, na.rm = TRUE)
no_rm_clear_contents <-length(ds_rm_clear_contents[!is.na(ds_rm_clear_contents)])
pa_rm_clear_contents <- (no_zero_rm_clear_contents/no_rm_clear_contents)*100
pa_rm_clear_contents
#missing values
ds_rm_metadata_standard <- df_t$rm_metadata_standard.Sean - df_t$rm_metadata_standard.Other
no_zero_rm_metadata_standard <- sum(ds_rm_metadata_standard == 0, na.rm = TRUE)
no_rm_metadata_standard <-length(ds_rm_metadata_standard[!is.na(ds_rm_metadata_standard)])
pa_rm_metadata_standard <- (no_zero_rm_metadata_standard/no_rm_metadata_standard)*100
pa_rm_metadata_standard
#missing values
ds_rm_filing_naming_convention <- df_t$rm_filing_naming_convention.Sean - df_t$rm_filing_naming_convention.Other
no_zero_rm_filing_naming_convention <- sum(ds_rm_filing_naming_convention == 0, na.rm = TRUE)
no_rm_filing_naming_convention <-length(ds_rm_filing_naming_convention[!is.na(ds_rm_filing_naming_convention)])
pa_rm_filing_naming_convention <- (no_zero_rm_filing_naming_convention/no_rm_filing_naming_convention)*100
pa_rm_filing_naming_convention
#missing values
ds_rm_index <- df_t$rm_index.Sean - df_t$rm_index.Other
no_zero_rm_index <- sum(ds_rm_index == 0, na.rm = TRUE)
no_rm_index <-length(ds_rm_index[!is.na(ds_rm_index)])
pa_rm_index <- (no_zero_rm_index/no_rm_index)*100
pa_rm_index
#missing values
ds_rm_inventory <- df_t$rm_inventory.Sean - df_t$rm_inventory.Other
no_zero_rm_inventory <- sum(ds_rm_inventory == 0, na.rm = TRUE)
no_rm_inventory <-length(ds_rm_inventory[!is.na(ds_rm_inventory)])
pa_rm_inventory <- (no_zero_rm_inventory/no_rm_inventory)*100
pa_rm_inventory
# missing values
ds_rm_license_rights <- df_t$rm_license_rights.Sean - df_t$rm_license_rights.Other
no_zero_rm_license_rights <- sum(ds_rm_license_rights == 0, na.rm = TRUE)
no_rm_license_rights <-length(ds_rm_license_rights[!is.na(ds_rm_license_rights)])
pa_rm_license_rights <- (no_zero_rm_license_rights/no_rm_license_rights)*100
pa_rm_license_rights
# missing values
ds_rm_abstract_proj_descr <- df_t$rm_abstract_proj_descr.Sean - df_t$rm_abstract_proj_descr.Other
no_zero_rm_abstract_proj_descr <- sum(ds_rm_abstract_proj_descr == 0, na.rm = TRUE)
no_rm_abstract_proj_descr <-length(ds_rm_abstract_proj_descr[!is.na(ds_rm_abstract_proj_descr)])
pa_rm_abstract_proj_descr <- (no_zero_rm_abstract_proj_descr/no_rm_abstract_proj_descr)*100
pa_rm_abstract_proj_descr
# missing values
ds_rm_creation_dates <- df_t$rm_creation_dates.Sean - df_t$rm_creation_dates.Other
no_zero_rm_creation_dates <- sum(ds_rm_creation_dates == 0, na.rm = TRUE)
no_rm_creation_dates <-length(ds_rm_creation_dates[!is.na(ds_rm_creation_dates)])
pa_rm_creation_dates <- (no_zero_rm_creation_dates/no_rm_creation_dates)*100
pa_rm_creation_dates
# missing values
ds_rm_ref_pub_supplementary <- df_t$rm_ref_pub_supplementary.Sean - df_t$rm_ref_pub_supplementary.Other
no_zero_rm_ref_pub_supplementary <- sum(ds_rm_ref_pub_supplementary == 0, na.rm = TRUE)
no_rm_ref_pub_supplementary <-length(ds_rm_ref_pub_supplementary[!is.na(ds_rm_ref_pub_supplementary)])
pa_rm_ref_pub_supplementary <- (no_zero_rm_ref_pub_supplementary/no_rm_ref_pub_supplementary)*100
pa_rm_ref_pub_supplementary
#missing values
ds_rm_operating_systems <- df_t$rm_operating_systems.Sean - df_t$rm_operating_systems.Other
no_zero_rm_operating_systems <- sum(ds_rm_operating_systems == 0, na.rm = TRUE)
no_rm_operating_systems <-length(ds_rm_operating_systems[!is.na(ds_rm_operating_systems)])
pa_rm_operating_systems <- (no_zero_rm_operating_systems/no_rm_operating_systems)*100
pa_rm_operating_systems
# missing values
ds_rm_sw_version_numbers <- df_t$rm_sw_version_numbers.Sean - df_t$rm_sw_version_numbers.Other
no_zero_rm_sw_version_numbers <- sum(ds_rm_sw_version_numbers == 0, na.rm = TRUE)
no_rm_sw_version_numbers <-length(ds_rm_sw_version_numbers[!is.na(ds_rm_sw_version_numbers)])
pa_rm_sw_version_numbers <- (no_zero_rm_sw_version_numbers/no_rm_sw_version_numbers)*100
pa_rm_sw_version_numbers
# missing values
ds_rm_limitations <- df_t$rm_limitations.Sean - df_t$rm_limitations.Other
no_zero_rm_limitations <- sum(ds_rm_limitations == 0, na.rm = TRUE)
no_rm_limitations <-length(ds_rm_limitations[!is.na(ds_rm_limitations)])
pa_rm_limitations <- (no_zero_rm_limitations/no_rm_limitations)*100
pa_rm_limitations
# missing values
ds_data_dictionary_shared <- df_t$data_dictionary_shared.Sean - df_t$data_dictionary_shared.Other
no_zero_data_dictionary_shared <- sum(ds_data_dictionary_shared == 0, na.rm = TRUE)
no_data_dictionary_shared <-length(ds_data_dictionary_shared[!is.na(ds_data_dictionary_shared)])
pa_data_dictionary_shared <- (no_zero_data_dictionary_shared/no_data_dictionary_shared)*100
pa_data_dictionary_shared
#100%
ds_dd_variables_intelligble <- df_t$dd_variables_intelligble.Sean - df_t$dd_variables_intelligble.Other
no_zero_dd_variables_intelligble <- sum(ds_dd_variables_intelligble == 0, na.rm = TRUE)
no_dd_variables_intelligble <-length(ds_dd_variables_intelligble[!is.na(ds_dd_variables_intelligble)])
pa_dd_variables_intelligble <- (no_zero_dd_variables_intelligble/no_dd_variables_intelligble)*100
pa_dd_variables_intelligble
#missing values
ds_dd_abbreviations_limited <- df_t$dd_abbreviations_limited.Sean - df_t$dd_abbreviations_limited.Other
no_zero_dd_abbreviations_limited <- sum(ds_dd_abbreviations_limited == 0, na.rm = TRUE)
no_dd_abbreviations_limited <-length(ds_dd_abbreviations_limited[!is.na(ds_dd_abbreviations_limited)])
pa_dd_abbreviations_limited <- (no_zero_dd_abbreviations_limited/no_dd_abbreviations_limited)*100
pa_dd_abbreviations_limited
#missing values
ds_dd_abbreviations_defined <- df_t$dd_abbreviations_defined.Sean - df_t$dd_abbreviations_defined.Other
no_zero_dd_abbreviations_defined <- sum(ds_dd_abbreviations_defined == 0, na.rm = TRUE)
no_dd_abbreviations_defined <-length(ds_dd_abbreviations_defined[!is.na(ds_dd_abbreviations_defined)])
pa_dd_abbreviations_defined <- (no_zero_dd_abbreviations_defined/no_dd_abbreviations_defined)*100
pa_dd_abbreviations_defined
# missing values
ds_dd_truncated_variables <- df_t$dd_truncated_variables.Sean - df_t$dd_truncated_variables.Other
no_zero_dd_truncated_variables <- sum(ds_dd_truncated_variables == 0, na.rm = TRUE)
no_dd_truncated_variables <-length(ds_dd_truncated_variables[!is.na(ds_dd_truncated_variables)])
pa_dd_truncated_variables <- (no_zero_dd_truncated_variables/no_dd_truncated_variables)*100
pa_dd_truncated_variables
#missing values
ds_dd_coded_var_labels <- df_t$dd_coded_var_labels.Sean - df_t$dd_coded_var_labels.Other
no_zero_dd_coded_var_labels <- sum(ds_dd_coded_var_labels == 0, na.rm = TRUE)
no_dd_coded_var_labels <-length(ds_dd_coded_var_labels[!is.na(ds_dd_coded_var_labels)])
pa_dd_coded_var_labels <- (no_zero_dd_coded_var_labels/no_dd_coded_var_labels)*100
pa_dd_coded_var_labels
# missing values
ds_central_data_request <- df_t$central_data_request.Sean - df_t$central_data_request.Other
no_zero_central_data_request <- sum(ds_central_data_request == 0, na.rm = TRUE)
no_central_data_request <-length(ds_central_data_request[!is.na(ds_central_data_request)])
pa_central_data_request <- (no_zero_central_data_request/no_central_data_request)*100
pa_central_data_request
#missing values
ds_data_assigned_obj_identifiers <- df_t$data_assigned_obj_identifiers.Sean - df_t$data_assigned_obj_identifiers.Other
no_zero_data_assigned_obj_identifiers <- sum(ds_data_assigned_obj_identifiers == 0, na.rm = TRUE)
no_data_assigned_obj_identifiers <-length(ds_data_assigned_obj_identifiers[!is.na(ds_data_assigned_obj_identifiers)])
pa_data_assigned_obj_identifiers <- (no_zero_data_assigned_obj_identifiers/no_data_assigned_obj_identifiers)*100
pa_data_assigned_obj_identifiers
# missing values
ds_data_discoverability_tags <- df_t$data_discoverability_tags.Sean - df_t$data_discoverability_tags.Other
no_zero_data_discoverability_tags <- sum(ds_data_discoverability_tags == 0, na.rm = TRUE)
no_data_discoverability_tags <-length(ds_data_discoverability_tags[!is.na(ds_data_discoverability_tags)])
pa_data_discoverability_tags <- (no_zero_data_discoverability_tags/no_data_discoverability_tags)*100
pa_data_discoverability_tags
#missing values


###### make a dataset for comparing across an article
df_with_two$article_doi #list articles
######

article_1 <- subset(df_with_two, article_doi == "10.1016/j.clineuro.2014.02.016")
article1 <- article_1[2:73]
diff_article1 <- article1[1,] - article1[2,]
no_zero_article_1 <- sum(diff_article1 == 0, na.rm = TRUE)
no_article1 <- length(article1)
pa_article1 <- (no_zero_article_1/no_article1)*100
pa_article1

article_2 <- subset(df_with_two, article_doi == "10.1016/j.clineuro.2015.10.004")
article2 <- article_2[2:73]
diff_article2 <- article2[1,] - article2[2,]
no_zero_article_2 <- sum(diff_article2 == 0, na.rm = TRUE)
no_article2 <- length(article2)
pa_article2 <- (no_zero_article_2/no_article2)*100
pa_article2

article_3 <- subset(df_with_two, article_doi == "10.1016/j.jaapos.2014.06.006")
article3 <- article_3[2:73]
diff_article3 <- article3[1,] - article3[2,]
no_zero_article_3 <- sum(diff_article3 == 0, na.rm = TRUE)
no_article3 <- length(article3)
pa_article3 <- (no_zero_article_3/no_article3)*100
pa_article3

article_4 <- subset(df_with_two, article_doi == "10.1016/j.jmig.2011.01.009")
article4 <- article_4[2:73]
diff_article4 <- article4[1,] - article4[2,]
no_zero_article_4 <- sum(diff_article4 == 0, na.rm = TRUE)
no_article4 <- length(article4)
pa_article4 <- (no_zero_article_4/no_article4)*100
pa_article4

article_5 <- subset(df_with_two, article_doi == "10.1016/j.jpainsymman.2015.02.022")
article5 <- article_5[2:73]
diff_article5 <- article5[1,] - article5[2,]
no_zero_article_5 <- sum(diff_article5 == 0, na.rm = TRUE)
no_article5 <- length(article5)
pa_article5 <- (no_zero_article_5/no_article5)*100
pa_article5

article_6 <- subset(df_with_two, article_doi == "10.1016/j.urology.2012.11.002")
article6 <- article_6[2:73]
diff_article6 <- article6[1,] - article6[2,]
no_zero_article_6 <- sum(diff_article6 == 0, na.rm = TRUE)
no_article6 <- length(article6)
pa_article6 <- (no_zero_article_6/no_article6)*100
pa_article6


article_7 <- subset(df_with_two, article_doi == "10.1097/AJP.0b013e3181f06b06")
article7 <- article_7[2:73]
diff_article7 <- article7[1,] - article7[2,]
no_zero_article_7 <- sum(diff_article7 == 0, na.rm = TRUE)
no_article7 <- length(article7)
pa_article7 <- (no_zero_article_7/no_article7)*100
pa_article7
# %
article_8 <- subset(df_with_two, article_doi == "10.1097/IOP.0b013e31828a92b0")
article8 <- article_8[2:73]
diff_article8 <- article8[1,] - article8[2,]
no_zero_article_8 <- sum(diff_article8 == 0, na.rm = TRUE)
no_article8 <- length(article8)
pa_article8 <- (no_zero_article_8/no_article8)*100
pa_article8

article_9 <- subset(df_with_two, article_doi == "10.1148/radiol.14132418")
article9 <- article_9[2:73]
diff_article9 <- article9[1,] - article9[2,]
no_zero_article_9 <- sum(diff_article9 == 0, na.rm = TRUE)
no_article9 <- length(article9)
pa_article9 <- (no_zero_article_9/no_article9)*100
pa_article9

article_10 <- subset(df_with_two, article_doi == "10.1158/1055-9965.EPI-14-0487")
article10 <- article_10[2:73]
diff_article10 <- article10[1,] - article10[2,]
no_zero_article_10 <- sum(diff_article10 == 0, na.rm = TRUE)
no_article10 <- length(article10)
pa_article10 <- (no_zero_article_10/no_article10)*100
pa_article10

article_11 <- subset(df_with_two, article_doi == "10.1186/1472-6963-13-414")
article11 <- article_11[2:73]
diff_article11 <- article11[1,] - article11[2,]
no_zero_article_11 <- sum(diff_article11 == 0, na.rm = TRUE)
no_article11 <- length(article11)
pa_article11 <- (no_zero_article_11/no_article11)*100
pa_article11

article_12 <- subset(df_with_two, article_doi == "10.1542/hpeds.2014-0085")
article12 <- article_12[2:73]
diff_article12 <- article12[1,] - article12[2,]
no_zero_article_12 <- sum(diff_article12 == 0, na.rm = TRUE)
no_article12 <- length(article12)
pa_article12 <- (no_zero_article_12/no_article12)*100
pa_article12

article_13 <- subset(df_with_two, article_doi == "PMC4384267")
article13 <- article_13[2:73]
diff_article13 <- article13[1,] - article13[2,]
no_zero_article_13 <- sum(diff_article13 == 0, na.rm = TRUE)
no_article13 <- length(article13)
pa_article13 <- (no_zero_article_13/no_article13)*100
pa_article13

article_14 <- subset(df_with_two, article_doi == "10.1016/j.burns.2013.12.002")
article14 <- article_14[2:73]
diff_article14 <- article14[1,] - article14[2,]
no_zero_article_14 <- sum(diff_article14 == 0, na.rm = TRUE)
no_article14 <- length(article14)
pa_article14 <- (no_zero_article_14/no_article14)*100
pa_article14

article_15 <- subset(df_with_two, article_doi == "10.1016/j.clinthera.2011.08.005")
article15 <- article_15[2:73]
diff_article15 <- article15[1,] - article15[2,]
no_zero_article_15 <- sum(diff_article15 == 0, na.rm = TRUE)
no_article15 <- length(article15)
pa_article15 <- (no_zero_article_15/no_article15)*100
pa_article15

article_16 <- subset(df_with_two, article_doi == "10.1016/j.joms.2016.01.001")
article16 <- article_16[2:73]
diff_article16 <- article16[1,] - article16[2,]
no_zero_article_16 <- sum(diff_article16 == 0, na.rm = TRUE)
no_article16 <- length(article16)
pa_article16 <- (no_zero_article_16/no_article16)*100
pa_article16

article_17 <- subset(df_with_two, article_doi == "10.1016/j.jstrokecerebrovasdis.2015.06.043")
article17 <- article_17[2:73]
diff_article17 <- article17[1,] - article17[2,]
no_zero_article_17 <- sum(diff_article17 == 0, na.rm = TRUE)
no_article17 <- length(article17)
pa_article17 <- (no_zero_article_17/no_article17)*100
pa_article17

article_18 <- subset(df_with_two, article_doi == "10.1016/j.ygyno.2013.04.055")
article18 <- article_18[2:73]
diff_article18 <- article18[1,] - article18[2,]
no_zero_article_18 <- sum(diff_article18 == 0, na.rm = TRUE)
no_article18 <- length(article18)
pa_article18 <- (no_zero_article_18/no_article18)*100
pa_article18

article_19 <- subset(df_with_two, article_doi == "10.1097/PSY.0b013e31821fbf9a")
article19 <- article_19[2:73]
diff_article19 <- article19[1,] - article19[2,]
no_zero_article_19 <- sum(diff_article19 == 0, na.rm = TRUE)
no_article19 <- length(article19)
pa_article19 <- (no_zero_article_19/no_article19)*100
pa_article19

article_20 <- subset(df_with_two, article_doi == "10.1111/apt.13505")
article20 <- article_20[2:73]
diff_article20 <- article20[1,] - article20[2,]
no_zero_article_20 <- sum(diff_article20 == 0, na.rm = TRUE)
no_article20 <- length(article20)
pa_article20 <- (no_zero_article_20/no_article20)*100
pa_article20

article_21 <- subset(df_with_two, article_doi == "10.1136/amiajnl-2014-002768")
article21 <- article_21[2:73]
diff_article21 <- article21[1,] - article21[2,]
no_zero_article_21 <- sum(diff_article21 == 0, na.rm = TRUE)
no_article21 <- length(article21)
pa_article21 <- (no_zero_article_21/no_article21)*100
pa_article21

article_22 <- subset(df_with_two, article_doi == "10.1136/bmjopen-2012-002367")
article22 <- article_22[2:73]
diff_article22 <- article22[1,] - article22[2,]
no_zero_article_22 <- sum(diff_article22 == 0, na.rm = TRUE)
no_article22 <- length(article22)
pa_article22 <- (no_zero_article_22/no_article22)*100
pa_article22

article_23 <- subset(df_with_two, article_doi == "10.1186/1471-2318-14-75")
article23 <- article_23[2:73]
diff_article23 <- article23[1,] - article23[2,]
no_zero_article_23 <- sum(diff_article23 == 0, na.rm = TRUE)
no_article23 <- length(article23)
pa_article23 <- (no_zero_article_23/no_article23)*100
pa_article23

article_24 <- subset(df_with_two, article_doi == "10.1186/1471-2334-13-171")
article24 <- article_24[2:73]
diff_article24 <- article24[1,] - article24[2,]
no_zero_article_24 <- sum(diff_article24 == 0, na.rm = TRUE)
no_article24 <- length(article24)
pa_article24 <- (no_zero_article_24/no_article24)*100
pa_article24

article_25 <- subset(df_with_two, article_doi == "10.1186/1471-2393-14-168")
article25 <- article_25[2:73]
diff_article25 <- article25[1,] - article25[2,]
no_zero_article_25 <- sum(diff_article25 == 0, na.rm = TRUE)
no_article25 <- length(article25)
pa_article25 <- (no_zero_article_25/no_article25)*100
pa_article25

article_26 <- subset(df_with_two, article_doi == "10.1186/1472-6823-13-24")
article26 <- article_26[2:73]
diff_article26 <- article26[1,] - article26[2,]
no_zero_article_26 <- sum(diff_article26 == 0, na.rm = TRUE)
no_article26 <- length(article2al6)
pa_article26 <- (no_zero_article_26/no_article26)*100
pa_article26

article_27 <- subset(df_with_two, article_doi == "10.1186/1472-6947-14-38")
article27 <- article_27[2:73]
diff_article27 <- article27[1,] - article27[2,]
no_zero_article_27 <- sum(diff_article27 == 0, na.rm = TRUE)
no_article27 <- length(article27)
pa_article27 <- (no_zero_article_27/no_article27)*100
pa_article27

article_28 <- subset(df_with_two, article_doi == "10.1186/s12911-015-0162-6")
article28 <- article_28[2:73]
diff_article28 <- article28[1,] - article28[2,]
no_zero_article_28 <- sum(diff_article28 == 0, na.rm = TRUE)
no_article28 <- length(article28)
pa_article28 <- (no_zero_article_28/no_article28)*100
pa_article28

article_29 <- subset(df_with_two, article_doi == "10.1186/s13054-015-1180-6")
article29 <- article_29[2:73]
diff_article29 <- article29[1,] - article29[2,]
no_zero_article_29 <- sum(diff_article29 == 0, na.rm = TRUE)
no_article29 <- length(article29)
pa_article29 <- (no_zero_article_29/no_article29)*100
pa_article29

article_30 <- subset(df_with_two, article_doi == "10.1371/journal.pone.0136651")
article30 <- article_30[2:73]
diff_article30 <- article30[1,] - article30[2,]
no_zero_article_30 <- sum(diff_article30 == 0, na.rm = TRUE)
no_article30 <- length(article30)
pa_article30 <- (no_zero_article_30/no_article30)*100
pa_article30

article_31 <- subset(df_with_two, article_doi == "10.2196/jmir.4976")
article31 <- article_31[2:73]
diff_article31 <- article31[1,] - article31[2,]
no_zero_article_31 <- sum(diff_article31 == 0, na.rm = TRUE)
no_article31 <- length(article31)
pa_article31 <- (no_zero_article_31/no_article31)*100
pa_article31


article_32 <- subset(df_with_two, article_doi == "10.2196/medinform.4732")
article32 <- article_32[2:73]
diff_article32 <- article32[1,] - article32[2,]
no_zero_article_32 <- sum(diff_article32 == 0, na.rm = TRUE)
no_article32 <- length(article32)
pa_article32 <- (no_zero_article_32/no_article32)*100
pa_article32

article_33 <- subset(df_with_two, article_doi == "10.2217/pgs.11.164")
article33 <- article_33[2:73]
diff_article33 <- article33[1,] - article33[2,]
no_zero_article_33 <- sum(diff_article33 == 0, na.rm = TRUE)
no_article33 <- length(article33)
pa_article33 <- (no_zero_article_33/no_article33)*100
pa_article33

article_34 <- subset(df_with_two, article_doi == "10.2307/1127750")
article34 <- article_34[2:73]
diff_article34 <- article34[1,] - article34[2,]
no_zero_article_34 <- sum(diff_article34 == 0, na.rm = TRUE)
no_article34 <- length(article34)
pa_article34 <- (no_zero_article_34/no_article34)*100
pa_article34

article_35 <- subset(df_with_two, article_doi == "10.2337/dc12-0964")
article35 <- article_35[2:73]
diff_article35 <- article35[1,] - article35[2,]
no_zero_article_35 <- sum(diff_article35 == 0, na.rm = TRUE)
no_article35 <- length(article35)
pa_article35 <- (no_zero_article_35/no_article35)*100
pa_article35

article_36 <- subset(df_with_two, article_doi == "10.3399/bjgp15X686113")
article36 <- article_36[2:73]
diff_article36 <- article36[1,] - article36[2,]
no_zero_article_36 <- sum(diff_article36 == 0, na.rm = TRUE)
no_article36 <- length(article36)
pa_article36 <- (no_zero_article_36/no_article36)*100
pa_article36

article_37 <- subset(df_with_two, article_doi == "10.5888/pcd10.120097")
article37 <- article_37[2:73]
diff_article37 <- article37[1,] - article37[2,]
no_zero_article_37 <- sum(diff_article37 == 0, na.rm = TRUE)
no_article37 <- length(article37)
pa_article37 <- (no_zero_article_37/no_article37)*100
pa_article37

article_38 <- subset(df_with_two, article_doi == "PMC3814479")
article38 <- article_38[2:73]
diff_article38 <- article38[1,] - article38[2,]
no_zero_article_38 <- sum(diff_article38 == 0, na.rm = TRUE)
no_article38 <- length(article38)
pa_article38 <- (no_zero_article_38/no_article38)*100
pa_article38

article_39 <- subset(df_with_two, article_doi == "PMC4820287")
article39 <- article_39[2:73]
diff_article39 <- article39[1,] - article39[2,]
no_zero_article_39 <- sum(diff_article39 == 0, na.rm = TRUE)
no_article39 <- length(article39)
pa_article39 <- (no_zero_article_39/no_article39)*100
pa_article39