我需要帮助处理 "data.py" 文件
from future import print_function import os import random import re import numpy as np import config def get_lines(): id2line = {} file_path = os.path.join(config.DATA_PATH, config.LINE_FILE) with open(file_path, 'rb') as f: lines = f.readlines() for line in lines: parts = line.split(b' +++$+++ ') if len(parts) == 5: if parts[4][-1] == b'\n': parts[4] = parts[4][:-1] id2line[parts[0]] = parts[4] return id2line def get_convos(): """ Get conversations from the raw data """ file_path = os.path.join(config.DATA_PATH, config.CONVO_FILE) convos = [] with open(file_path, 'rb') as f: for line in f.readlines(): parts = line.split(b' +++$+++ ') if len(parts) == 4: convo = [] for line in parts[3][1:-2].split(b', '): convo.append(line[1:-1]) convos.append(convo) return convos def question_answers(id2line, convos): """ Divide the dataset into two sets: questions and answers. """ questions, answers = [], [] for convo in convos: for index, line in enumerate(convo[:-1]): questions.append(id2line[convo[index]]) …
内容来源: chiphuyen/stanford-tensorflow-tutorials