From 0501ad8ecb1822247ccad9d1e6ccf232f22efc92 Mon Sep 17 00:00:00 2001 From: Adam Janovsky Date: Wed, 11 Nov 2020 17:43:41 +0100 Subject: added oop demo script --- oop_demo.py | 28 ++++++++++++++++++++++++++++ sec_certs/dataset.py | 1 + 2 files changed, 29 insertions(+) create mode 100644 oop_demo.py diff --git a/oop_demo.py b/oop_demo.py new file mode 100644 index 00000000..2d76a6c4 --- /dev/null +++ b/oop_demo.py @@ -0,0 +1,28 @@ +from sec_certs.dataset import CCDataset, DatasetJSONEncoder +from pathlib import Path +from datetime import datetime +import logging +import json + + +def main(): + logging.basicConfig(level=logging.INFO) + start = datetime.now() + + # Create empty dataset + dset = CCDataset({}, Path('./debug_dataset'), 'sample_dataset', 'sample dataset description') + + # Load metadata for certificates from CSV and HTML sources + dset.get_certs_from_web() + logging.info(f'Finished parsing. Have dataset with {len(dset)} certificates.') + + # Dump dataset into JSON + with open('./debug_dataset/cc_full_dataset.json', 'w') as handle: + json.dump(dset, handle, cls=DatasetJSONEncoder, indent=4) + + end = datetime.now() + logging.info(f'The computation took {(end-start)} seconds.') + + +if __name__ == '__main__': + main() diff --git a/sec_certs/dataset.py b/sec_certs/dataset.py index c430929b..ad26d7b1 100644 --- a/sec_certs/dataset.py +++ b/sec_certs/dataset.py @@ -133,6 +133,7 @@ class CCDataset(Dataset): """ self.web_dir.mkdir(parents=True, exist_ok=True) + logging.info('Downloading required csv and html files.') html_items = [(x, self.web_dir / y) for y, x in self.html_products.items()] csv_items = [(x, self.web_dir / y) for y, x in self.csv_products.items()] helpers.download_parallel(html_items, num_threads=8) -- cgit v1.3.1