вторник, 13 ноября 2012 г.

Загружаем большие объемы данных в oracle

При создании адекватных тестовых данных принято использовать интерфейсы самого приложения, его api, формы, библиотеки и т.д... Но когда необходимо создавать большие массивы тестовых данных, стандартные интерфейсы могут оказаться черезчур медлительными.

Например , вы хотите заполнить биллинговую БД десятью миллионами клиентов, которые тянут за собой другие десятки миллионов сопутствующих записей в разных таблицах схемы (речь в данном посте идет именно о реляционных субд).

Каждая реляционная субд имеет свои механизмы дампа, заливки, импорта , экспорта... Даже простецкий sqlite имеет свой  .dump.

Я бы хотел поделиться некоторыми аспектами создания больших объемов тестовых данных в субд Oracle.

Существует несколько вариантов:

Самый неудачный вариант - с наскока написать скрипт, который бы генерировал данные с помощью обычного DML. Подобное решение будет работать долго и потреблять слишком много ресурсов субд, связанных с ведением redo-логов, распуханием сегмента отката, фиксацией изменений (commit).

Другой вариант - использовать штатные оракловые утилиты бекапа и восстановления : imp , exp , которые очень шустро работают. Но этот вариант применим в ситуации, когда у вас уже имеется эталонная схема с нужным количеством данных - вы просто экспортируете (в бинарный файл) из нее все или часть данных и импортируете в нужную схему из полученного бинарного дампа. Например, таким образом, можно слить данные с боевой БД заказчика, разумеется, если он дает на это добро. К тому же использовать этот метод рекомендуется для работы с БД до 50 - 60 GB.

Ну и наиболее подходящий вариант - использование SQL*Loader.
Метод относительно быстр , гибок в настройке хоть и имеет свои особенности. Загрузка осуществляется оракловой утилитой sqlldr.
Ей на вход необходимо передать обязательно: управляющий файл и файл с данными, и необязательно  - файл пераметров.

Управляющий файл - это текстовый файл, который формируется загружающим вручную и содержит спецификацию того, откуда брать входные данные, каков их формат, параметры конфигурации загрузки, правила изменения данных при загрузке... Максимально  детально о формате управляющего файла можно ознакомиться в официальной доке.

Файл с данными - файл, сформированный внешней программой/скриптом и который содержит данные, которые надо загрузить. Формат файла может быть как текстовый так и бинарный. Как именно интерпретировать записи этого файла - указывается в управляющем файле. Если файл текстовый, то разделители записей, признаки конца записи (для мультистрочных записей) - все это также регулируется в управляющем файле.

Файл с параметрами - текстовый файл , в котором указываются параметры командной строки. Например sqlldr PARFILE=parameters.par 

Что же делает imp , sqlldr быстрыми? В первую очередь то, что они умеют использовать такую возможность Oracle, как метод "прямой вставки".

Прямая вставка - это почти тот же insert, который быстрее обычного за счет того , что при его использовании не тратится время на коммиты, redo-логи, большинство ограничений (кроме unique, primary key и not null) и insert-триггеры.
Чтобы sqlldr использовал метод прямой вставки, ему необходимо передать в командной строке или файле параметров опцию DIRECT=Y.
Кроме того, прямую вставку можно еще и распараллелить.
К слову, такой метод вставки можно использовать и самостоятельно.

Вот пример параллельного (в  2 процесса)  и нежурналируемого копирования данных из одной таблицы в другую.

ALTER SESSION ENABLE PARALLEL DML;
INSERT /*+parallel(new_users,2)*/ INTO users NOLOGGING
SELECT * FROM old_users

Наибольший выигрыш от распараллеливания  загрузки достигается на тех серверах, где более одного CPU.

Ну и напоследок несколько советов о том, как сделать процесс загрузки более оптимальным:

1. подготовьте место да диске, где будут лежать dbf-ы новой базы, достаточное для будущего объема данных (посмотрите сколько занимают dbf-ы старой =)
2. отключите индексы в таблицах , которые собираетесь заполнять
3. используйте прямую и по возможности параллельную вставку
4. отключите архиватор, если включен (напарывался на ситуацию, когда архиватор отжирал место почти равное тому, что занимала новая база - это совершенно ненужное при генерации тестовых данных архивирование!):

SHUTDOWN IMMEDIATE;
STARTUP MOUNT;
ALTER DATABASE NOARCHIVELOG;
ALTER DATABASE OPEN;

Если же архиватор все таки не был отключен и отожрал место на диске архивными dbf-ами, то их можно легко удалить.
Для этого в папке с архивными dbf-ами удалить все ненужные архивы и после этого с помощью rman избавиться от соответствующих записей в БД:

rman target sys@dbsid
crosscheck archivelog all;
delete noprompt expired archivelog all;


Хорошую подборка проверенных советов по оптимизации именно SQL*Loader можно найти здесь

На полноту охвата темы не претендую, но , надеюсь, у того кто с описанными вкратце механизмами не знаком , появится вектор, куда копать в случае необходимости :)

четверг, 1 ноября 2012 г.

Практичный WWW::Mechanize

Так сложилось, что мне частенько приходится пользоваться различными виртуальными хостингами.
С недавнего времени среди тех, которыми я часто пользуюсь появился такой хостер, который разрешает подключаться к серверу по SSH только с одного IP.
При этом , конечно же, позволяет указывать разрешенный IP в хостинг-панели.
В целом, штука конечно-же, секьюрная , но немного неудобная.
Теперь мы все стали мобильные, наши IP-ы часто меняются - дома один, в дороге или кафе - другой,  в офисе - третий.
Один раз залезешь - переключишь, другой, а на третий уже автоматизируешь.
Так поступил и я... В голове сразу мелькнули мысли от трех вариантах - Selenium, Jmeter и гипотетический perl-скрипт с использованием WWW::Mechanize.

По ряду причин решил использовать второй третий вариант...

Для этого нужно:

  1. perl  c установленным WWW::Mechanize, а лучше и Test::WWW::Mechanize
  2. Firefox с включенным плагином MozRepl ( ТОЛЬКО ЕСЛИ ЗАХОТИТЕ СНИМАТЬ СКРИНШОТЫ!)
  3. Пара минут времени

#!/usr/bin/perl -w use utf8;
 use Test::More "no_plan"; 
 use Test::WWW::Mechanize; 
 use constant URL => 'нужный урл'; 
 use constant LOGIN =>; 'логин к админ панели'; 
 use constant PASSWORD =>; 'пароль к админ панели'; 

 my $m = Test::WWW::Mechanize->new(autolint=>0); 
 $m->get_ok( URL , 'Open login page'); 
 $m->content_contains( 'Контрольная панель' , 'Check we are on right page'); 
 $m->submit_form_ok({ 
    form_number =>; 1, 
    fields => { 
      login => LOGIN, 
      password => PASSWORD, 
    }, 
 } , 'Submit login form' ); 
 $m->follow_link_ok( { 
        text_regex => qr/Настройки SSH/i 
     } , 'Follow ssh settings link'); 
 $m->content_contains( 'Настройки SSH' , "Check we are on right page"); 
 $m-$gt;follow_link_ok( {id =>; 'user-ip' }, "Allow current ip"); 
 my $link =$m->find_link( id => 'user-ip' ); ok($link, 'Get current ip from page'); 
 $m->submit_form_ok({ form_number => 1, fields => { ip => $link->text, }, } , 'Submit ip changing form' );


В скрипте используется Test::WWW::Mechanize - обертка над WWW::Mechanize  , которая используется в написании автотестов, что делает этот скрипт по сути автотестом с наглядным логированием в консоль:

$ ./ssh_switcher 
ok 1 - Open login page 
ok 2 - Check we are on right page 
ok 3 - Submit login form 
ok 4 - Follow ssh settings link 
ok 5 - Check we are on right page 
ok 6 - Allow current ip 

ok 7 - Get current ip from page
ok 8 - Submit ip changing form
1..8

Ну и этот "тест" потестить тоже надо бы.. Убеждаемся, что до запуска ssh-соединение не устанавливаетса, а после запуска - проблем нет.


Таким образом, скрипт реально экономит мне время и нервы, позволяя одним кликом разрешить текущий ip-с которым я вышел в сеть - не надо открывать браузер, панель, помнить и вводить логин , пароль (очень хитрый и длинный пароль)...

Разумеется, это  подходит только для данного конкретного хостера и его алгоритма смены разрешенного ip ) И, конечно же, хостер может изменить названия переменных, ссылок, вообще поменять логику - это не проблема, скорректировать скрипт дело пары минут :)

Не а ежели хостер навесит капчу, то будет очень интересно решить эту задачу, тем более, что кое-какие наработки где-то в дебрях харда валялись )

p.s. в целом WWW::Mechanize очень даже применим для автоматизации сценариев , а его обертка Test::WWW::Mechanize - даже для создания функциональных автотестов.

вторник, 16 октября 2012 г.

Монтируем yandex disk

Яндекс недавно запустил наш отечественный аналог dropbox-а - "Yandex disk", который позволяет получить как минимум 10гб бесплатного облачного хранилища файлов.

Одним из преимуществ использования этого "еще одного облачного хранилища" в том, что его можно примонтировать с помощью davfs2 (WebDAV Linux File System) ( как локальный диск без особых трудностей. Разумеется , речь идет о linux.
Перед началом опыта надо , разумеется, зарегистрировать (если еще такого нет) аккаунт у "Яндекса".

Пример для debian или debian-подобного дистрибутива:

$ mkdir /home/linuxuser/yandex #создаем у себя в хомяке директорию для содержимого "диска" 
$ sudo apt-get install davfs2 

$ sudo mount -t davfs https://webdav.yandex.ru /home/linuxuser/yandex/

Будет запрос ввода логина и пароля к учетной записи на "яндексе" - вводим )
Чтобы избежать ввода при каждом монтировании можно добавить данные учетной записи в /etc/davfs2/secrets

 $ sudo /vim/etc/davfs2/secrets #в конец файла добавляем строку https://webdav.yandex.ru "логин" "пароль", подставляя свой логин и пароль

Проверяем содержимое директории с диском  

$ ls -l /home/linuxuser/yandex 

drwx------ 2 root root 0 Окт 16 08:16 lost+found 
-rw-r--r-- 1 root root 455833 Окт 4 18:44 Добро Пожаловать.pdf 
drwxr-xr-x 2 root root 0 Окт 4 18:44 Документы 
drwxr-xr-x 2 root root 0 Окт 4 18:44 Музыка 
-rw-r--r-- 1 root root 937311 Окт 4 18:44 Обои для рабочего стола.jpg 

Это дефолтное содержимое Как видим все от рута.
Чтобы дать возможность пользователю linuxuser пользоваться всеми благами примонтированного "диска" делаем следующее:  

$ sudo vim /etc/fstab

Прописываем строку:  

https://webdav.yandex.ru /home/linuxuser/yandex davfs uid=linuxuser,file_mode=640,dir_mode=755,user,noauto 0 0 

Затем добавляем пользователя в группу davfs2, которая была создана автоматически при установке davfs2 и добавляем права на запуск mount.davfs  

$ sudo usermod -a -G davfs2 linuxuser $ sudo chmod 4755 /usr/sbin/mount.davfs

Теперь проверяем , что все ок от имени пользователя  

$ umount /home/linuxuser/yandex 
$ mount /home/linuxuser/yandex 
$ ls -l /home/linuxuser/yandex 

drwx------ 2 linuxuser linuxuser 0 Окт 16 08:25 lost+found 
-rw-r----- 1 linuxuser linuxuser 455833 Окт 4 18:44 Добро Пожаловать.pdf 
drwxr-xr-x 2 linuxuser linuxuser 0 Окт 4 18:44 Документы 
drwxr-xr-x 2 linuxuser linuxuser 0 Окт 4 18:44 Музыка 
-rw-r----- 1 linuxuser linuxuser 937311 Окт 4 18:44 Обои для рабочего стола.jpg 

Удачного и полезного использования )

Ссылки:
WebDAV file system project
Yandex Disk

понедельник, 15 октября 2012 г.

blogger.com обнулена статистика просмотров ?

Сегодня с удивлением обнаружил обнуление статистики просмотра страниц блога у blogger.com.
Проблема , видимо, касается если не всех blogger.com-пользователей, то многих (первая реакция blogger.com).
Не смертельно, конечно, но неприятно.
Надеюсь, починят.


среда, 3 октября 2012 г.

Когда теория расходится с практикой

Многим из нас , наверняка, приходилось переживать волну энтузиазма, вызванного очередной прочитанной ИТ-книгой, очередной изученной методологией, которая после осмысления удивительно удачно разрешила бы текущие производственные проблемы, вопросы, недопонимание.
Воображение строит план, перспективы применения новых знаний заманчивы.. В теории красиво и ладно. Сплошной позитив. И вот ты весь такой позитивный и вооруженный погружаешься опять в производственную текучку. А ее участникам порой нет дела то книг, которые ты прочел, навыков , которые ты прокачал, обдуманных лучших практик, которые действительно оказали бы полезны в данном конкретном процессе... Инцерция. Твоя теория сталкивается с твоей же практикой. И очень важно , столкнувшись с ней, не сбиться в критиканство, не конфликтовать с людьми и беречь свой энтузиазм, стараясь конструктивно влиять на процесс. Стоит понимать, что люди годами работают по накатанным рельсам и даже , порой понимая, что рельсы эти устарели , не могут или не хотят (а иногда и не имеют права) что-либо менять.
Ну и всегда остается шанс того, что ты , впадая в эйфорию от новых знаний и жажды их применения, чего-то такого не учел, что делает в данном конкретном случае старые ржавые рельсы гораздо привлекательнее , чем все такие раскрасивые новые...

вторник, 2 октября 2012 г.

yandex.browser - первое впечателение о новом игроке

Кто не слышал и не в курсе - вчера вышла в массы первая версия браузера от Yandex. Все логично. Поисковик развивается динамично. Под рукой куча открытых технологий, из которых при желании и наличии средств можно попытаться сделать успешный продукт. По первому впечатлению - броузер мало чем отличается от Chromium, на основе которого он, собственно , и был собран. Изменения чисто косметические и затронули в основном верхнюю панель и строку адреса - так называемую "умную строку". "НАстройки", "Инструменты разработчика" - это все 1 в 1 как в Chromium. Что, вообще-то , не плохо) "Умную строку" я пока назвал бы "раздражающей строкой" - при клике на нее выскакивает здоровенная панель с кнопками , ведущими на различные Я-сервисы... Это дело , правда, отключается в "Настройках". В целом от браузера жтать чего-то сверхнового пока рано: как в хорошем смысле (новая функциональность) так и в плохом (новые баги). Новые фишки , надеюсь, скоро появятся. Новые баги, надеюсь, тоже =) А пока в помощь исследователям Яндекс честно приводит список стороннего софта, использованного в разработке. Из основного: js-движок "V8", парсер XML - expat, утечки искали Valgrind-ом и еще много другого... Жаль вот только версии стороннего софта не указываются :) Посмотреть на все это можно , набрав "chrome://Credits" в "умной строке". Пожелаю удачи новому броузеру - я за разнообразие !) p.s. отдельное спасибо за любезную landing-страницу для linux-пользователей. Будем ждать первых версий и для этой ОС.

среда, 26 сентября 2012 г.

Логи и безопасность - практика показывает

Надавно высказывал свои размышления на тему логов и безопасности... Сегодня на хабре попалась заметка о реальном случае, подтверждающем то, что к логам надо относиться более внимательно и осторожно )

понедельник, 24 сентября 2012 г.

Игры со временем продолжаются

Только-только утихли споры по поводу перехода на постоянное летнее время, даже самые ленивые админы уже обновили tz-либы на своих серверах . И вот-те на. Опять , по-видимому, грядет переход - теперь на "постоянное зимнее". Понятно, что кому-то хочется удовлетворить свой законотворческий зуд, кому-то хочется набрать очков в глазах избирателей, которым пришелся не по нраву прошлый перевод, а кому-то хочется опять хоть как-то войти в историю (на худой конец вляпаться). Ну а нам опять, судя по всему, пере-привыкать, пере-проверять и пере-накладывать патчи. А принимая во внимание хоть и туманную но перспективу Медведа вернуться в Кремль через ННое количество лет, старые патчи предлагаю далеко не убирать - вдруг опять на летнее ? :)

пятница, 14 сентября 2012 г.

mercurial: +100 к гибкости

Недавно обнаружил замечательное расширение для hg : crecord.
Оно позволяет делать построчные коммиты - то есть, выбирать конкретные строки, которые включить в очередной коммит.
Допустим у вас есть измененный файл и в стандартный diff попадают изменения , сделанные в рамках двух разных доработок. Изменения по одной из доработок вы хотите закоммитить,  а изменения по другой - пока не хотите. В этом случае как раз и поможет данное расширение..

Установка и подключение предельно просты:

1. выкачиваем расширение в локальную директорию из репозитория (расширение еще не включено в список стандартных)


$ hg clone https://bitbucket.org/edgimar/crecord
 
2. редактируем .hgrc файл  

[extensions] 



crecord = /путь/до/каталога/crecord/содержащего/__init__.py/ 

И теперь можем использовать как новую команду для hg:
$ hg crecord

В результате отображается консольный интерфейс с возможностью выбора отдельных файлов и отдельных строк в файлах, причем строки можно выбирать группами.

p.s.

Без багов, конечно же , тоже не обошлось:

hg crecord требует указания имени пользователя.
Требует - указываем ... через стандартный для hg  параметр -u

$ hg crecord -u someuser
.. а он не понимает и продолжает требовать.

Приходится явно прописывать в .hgrc

[ui]
username = someuser
Приятного использования!