同事近在忙数据一致性比对工作,需要对不同文本文件中的数据进行比对,有的文件较大,记录较多,如果用普通的文本编辑器打开的话,很显然,会很卡,甚至打不开。
  基于此,可将该文本文件的数据导入到数据库中,在集合的层面进行比对。
  那么如何将文本文件的数据导入到数据库中呢?在这里,主要利用了Oracle的外部表特性。
  Oracle外部表支持两种类型的驱动:一种是ORACLE_LOADER,外部表的数据必须来源于文件文件,另一种则是ORACLE_DATAPUMP,外部表的数据必须是二进制dump文件,该dump文件是先前将Oracle内部表的数据导入到外部表中填充的文件。很显然,Oracle希望将数据保留在数据库内部进行处理。
  首先,我们来看一下该文本文件的大小及记录。
  [oracle@node2 ~]$ du -sm P_20150626010000_2002371.0003479598
  274    P_20150626010000_2002371.0003479598
  [oracle@node2 ~]$ wc -l P_20150626010000_2002371.0003479598
  2899265 P_20150626010000_2002371.0003479598
  从上面的输出可以看出,该文件274M,有2899265条记录。
  其次,构建创建外部表语句。
CREATE TABLE emp_load
(subsid number(18),
servnumber VARCHAR2(20 CHAR),
subsprodid NUMBER(18),
prodid VARCHAR2(32 CHAR),
startdate date,
enddate  date,
owner VARCHAR2(4 CHAR))
ORGANIZATION EXTERNAL
(TYPE ORACLE_LOADER
DEFAULT DIRECTORY tmp
ACCESS PARAMETERS
(RECORDS DELIMITED BY NEWLINE
FIELDS TERMINATED BY "|"
( subsid      DECIMAL EXTERNAL,
servnumber  CHAR(20),
subsprodid  DECIMAL EXTERNAL,
prodid  CHAR(32),
startdate date "yyyymmddhh24miss",
enddate date "yyyymmddhh24miss",
owner   CHAR(4)
)
)
LOCATION ('P_20150626010000_2002371.0003479598')
);
  注意,目录tmp必须存在,因为我是在scott用户下执行的,所以scott用户必须对该路径有读写权限。
  第三、在scott用户下执行该建表语句。
  第四、查看生成的外部表是否有问题
  SQL> select count(*) from emp_load;
  COUNT(*)
  ------------------
  2899265
  记录与wc-l查看的记录数吻合。
  注意,建表过程中没有报错并不一定意味着数据已经成功加载在外部表中。必须通过查询外部表来判定数据是否已成功加载,倘若有错误提示,可参看当前目录下生成的日志文件,具体在本例中,是EMP_LOAD_2000.bad和EMP_LOAD_2000.log。