5#include <packager/media/formats/mp4/track_run_iterator.h>
15#include <absl/flags/flag.h>
16#include <absl/log/check.h>
17#include <absl/log/log.h>
19#include <packager/macros/logging.h>
20#include <packager/media/base/buffer_reader.h>
21#include <packager/media/base/decrypt_config.h>
22#include <packager/media/base/fourccs.h>
23#include <packager/media/base/rcheck.h>
24#include <packager/media/formats/mp4/box_definitions.h>
25#include <packager/media/formats/mp4/chunk_info_iterator.h>
26#include <packager/media/formats/mp4/composition_offset_iterator.h>
27#include <packager/media/formats/mp4/decoding_time_iterator.h>
28#include <packager/media/formats/mp4/sync_sample_iterator.h>
31 mp4_reset_initial_composition_offset_to_zero,
33 "MP4 only. If it is true, reset the initial composition offset to "
34 "zero, i.e. by assuming that there is a missing EditList.");
37const int64_t kInvalidOffset = std::numeric_limits<int64_t>::max();
39int64_t Rescale(int64_t time_in_old_scale,
42 return (
static_cast<double>(time_in_old_scale) / old_scale) * new_scale;
60 std::vector<SampleInfo> samples;
63 int64_t sample_start_offset;
66 const AudioSampleEntry* audio_description;
67 const VideoSampleEntry* video_description;
71 std::vector<SampleEncryptionEntry> sample_encryption_entries;
75 int64_t aux_info_start_offset;
76 int aux_info_default_size;
77 std::vector<uint8_t> aux_info_sizes;
78 int aux_info_total_size;
84TrackRunInfo::TrackRunInfo()
88 sample_start_offset(-1),
90 audio_description(NULL),
91 video_description(NULL),
92 aux_info_start_offset(-1),
93 aux_info_default_size(0),
94 aux_info_total_size(0) {}
95TrackRunInfo::~TrackRunInfo() {}
97TrackRunIterator::TrackRunIterator(
const Movie* moov)
98 : moov_(moov), sample_dts_(0), sample_offset_(0) {
102TrackRunIterator::~TrackRunIterator() {}
104static void PopulateSampleInfo(
const TrackExtends& trex,
105 const TrackFragmentHeader& tfhd,
106 const TrackFragmentRun& trun,
108 SampleInfo* sample_info) {
109 if (i < trun.sample_sizes.size()) {
110 sample_info->size = trun.sample_sizes[i];
111 }
else if (tfhd.default_sample_size > 0) {
112 sample_info->size = tfhd.default_sample_size;
114 sample_info->size = trex.default_sample_size;
117 if (i < trun.sample_durations.size()) {
118 sample_info->duration = trun.sample_durations[i];
119 }
else if (tfhd.default_sample_duration > 0) {
120 sample_info->duration = tfhd.default_sample_duration;
122 sample_info->duration = trex.default_sample_duration;
125 if (i < trun.sample_composition_time_offsets.size()) {
126 sample_info->cts_offset = trun.sample_composition_time_offsets[i];
128 sample_info->cts_offset = 0;
132 if (i < trun.sample_flags.size()) {
133 flags = trun.sample_flags[i];
134 }
else if (tfhd.flags & TrackFragmentHeader::kDefaultSampleFlagsPresentMask) {
135 flags = tfhd.default_sample_flags;
137 flags = trex.default_sample_flags;
139 sample_info->is_keyframe = !(flags & TrackFragmentHeader::kNonKeySampleMask);
153class CompareMinTrackRunDataOffset {
155 bool operator()(
const TrackRunInfo& a,
const TrackRunInfo& b) {
157 a.aux_info_total_size ? a.aux_info_start_offset : kInvalidOffset;
159 b.aux_info_total_size ? b.aux_info_start_offset : kInvalidOffset;
161 int64_t a_lesser = std::min(a_aux, a.sample_start_offset);
162 int64_t a_greater = std::max(a_aux, a.sample_start_offset);
163 int64_t b_lesser = std::min(b_aux, b.sample_start_offset);
164 int64_t b_greater = std::max(b_aux, b.sample_start_offset);
166 if (a_lesser == b_lesser)
167 return a_greater < b_greater;
168 return a_lesser < b_lesser;
175 for (std::vector<Track>::const_iterator trak = moov_->tracks.begin();
176 trak != moov_->tracks.end(); ++trak) {
178 trak->media.information.sample_table.description;
179 if (stsd.type != kAudio && stsd.type != kVideo) {
180 DVLOG(1) <<
"Skipping unhandled track type";
185 trak->media.information.sample_table.decoding_time_to_sample);
187 trak->media.information.sample_table.composition_time_to_sample);
188 bool has_composition_offset = composition_offset.
IsValid();
190 trak->media.information.sample_table.sample_to_chunk);
192 trak->media.information.sample_table.sync_sample);
197 trak->media.information.sample_table.sample_size;
198 const std::vector<uint64_t>& chunk_offset_vector =
199 trak->media.information.sample_table.chunk_large_offset.offsets;
203 int64_t run_start_dts = GetTimestampAdjustment(*moov_, *trak,
nullptr);
205 uint32_t num_samples = sample_size.sample_count;
206 uint32_t num_chunks =
static_cast<uint32_t
>(chunk_offset_vector.size());
209 DCHECK_EQ(num_samples, decoding_time.
NumSamples());
210 if (has_composition_offset) {
211 DCHECK_EQ(num_samples, composition_offset.
NumSamples());
213 if (num_chunks > 0) {
214 DCHECK_EQ(num_samples, chunk_info.
NumSamples(1, num_chunks));
218 if (num_samples > 0) {
220 RCHECK(decoding_time.
IsValid());
224 uint32_t sample_index = 0;
225 for (uint32_t chunk_index = 0; chunk_index < num_chunks; ++chunk_index) {
229 tri.track_id = trak->header.track_id;
230 tri.timescale = trak->media.header.timescale;
231 tri.start_dts = run_start_dts;
232 tri.sample_start_offset = chunk_offset_vector[chunk_index];
235 RCHECK(desc_idx > 0);
238 tri.track_type = stsd.type;
239 if (tri.track_type == kAudio) {
240 RCHECK(!stsd.audio_entries.empty());
241 if (desc_idx > stsd.audio_entries.size())
243 tri.audio_description = &stsd.audio_entries[desc_idx];
245 RCHECK(tri.audio_description->sinf.info.track_encryption
246 .default_is_protected == 0);
247 }
else if (tri.track_type == kVideo) {
248 RCHECK(!stsd.video_entries.empty());
249 if (desc_idx > stsd.video_entries.size())
251 tri.video_description = &stsd.video_entries[desc_idx];
253 RCHECK(tri.video_description->sinf.info.track_encryption
254 .default_is_protected == 0);
258 tri.samples.resize(samples_per_chunk);
259 for (uint32_t k = 0; k < samples_per_chunk; ++k) {
260 SampleInfo& sample = tri.samples[k];
261 sample.size = sample_size.sample_size != 0
262 ? sample_size.sample_size
263 : sample_size.sizes[sample_index];
266 has_composition_offset ? composition_offset.
sample_offset() : 0;
269 run_start_dts += sample.duration;
274 if (sample_index == num_samples) {
278 if (has_composition_offset)
282 if (has_composition_offset)
287 runs_.push_back(tri);
291 std::sort(runs_.begin(), runs_.end(), CompareMinTrackRunDataOffset());
292 run_itr_ = runs_.begin();
300 const auto track_count = std::max(moof.tracks.size(), moov_->tracks.size());
301 next_fragment_start_dts_.resize(track_count, 0);
302 for (
size_t i = 0; i < moof.tracks.size(); i++) {
304 const auto track_index = traf.header.track_id - 1;
305 const Track* trak = NULL;
306 for (
size_t t = 0; t < moov_->tracks.size(); t++) {
307 if (moov_->tracks[t].header.track_id == traf.header.track_id)
308 trak = &moov_->tracks[t];
313 for (
size_t t = 0; t < moov_->extends.tracks.size(); t++) {
314 if (moov_->extends.tracks[t].track_id == traf.header.track_id)
315 trex = &moov_->extends.tracks[t];
320 trak->media.information.sample_table.description;
321 if (stsd.type != kAudio && stsd.type != kVideo) {
322 DVLOG(1) <<
"Skipping unhandled track type";
325 size_t desc_idx = traf.header.sample_description_index;
327 desc_idx = trex->default_sample_description_index;
328 RCHECK(desc_idx > 0);
335 RCHECK(!stsd.audio_entries.empty());
336 if (desc_idx > stsd.audio_entries.size())
338 audio_sample_entry = &stsd.audio_entries[desc_idx];
341 RCHECK(!stsd.video_entries.empty());
342 if (desc_idx > stsd.video_entries.size())
344 video_sample_entry = &stsd.video_entries[desc_idx];
353 DCHECK(traf.sample_encryption.sample_encryption_entries.empty());
354 std::vector<SampleEncryptionEntry> sample_encryption_entries;
356 RCHECK(audio_sample_entry || video_sample_entry);
357 const uint8_t default_per_sample_iv_size =
358 audio_sample_entry ? audio_sample_entry->sinf.info.track_encryption
359 .default_per_sample_iv_size
360 : video_sample_entry->sinf.info.track_encryption
361 .default_per_sample_iv_size;
363 default_per_sample_iv_size, &sample_encryption_entries));
366 int64_t run_start_dts = traf.decode_time_absent
367 ? next_fragment_start_dts_[track_index]
368 : traf.decode_time.decode_time;
372 run_start_dts += GetTimestampAdjustment(*moov_, *trak, &traf);
374 int sample_count_sum = 0;
376 for (
size_t j = 0; j < traf.runs.size(); j++) {
379 tri.track_id = traf.header.track_id;
380 tri.timescale = trak->media.header.timescale;
381 tri.start_dts = run_start_dts;
382 tri.sample_start_offset = trun.data_offset;
384 tri.track_type = stsd.type;
385 tri.audio_description = audio_sample_entry;
386 tri.video_description = video_sample_entry;
388 tri.aux_info_start_offset = -1;
389 tri.aux_info_total_size = 0;
393 if (!sample_encryption_entries.empty()) {
394 RCHECK(sample_encryption_entries.size() >=
395 sample_count_sum + trun.sample_count);
396 for (
size_t k = 0; k < trun.sample_count; ++k) {
397 tri.sample_encryption_entries.push_back(
398 sample_encryption_entries[sample_count_sum + k]);
400 }
else if (traf.auxiliary_offset.offsets.size() > j) {
404 tri.aux_info_start_offset = traf.auxiliary_offset.offsets[j];
407 RCHECK(traf.auxiliary_size.sample_count >=
408 sample_count_sum + trun.sample_count);
409 tri.aux_info_default_size =
410 traf.auxiliary_size.default_sample_info_size;
411 if (tri.aux_info_default_size == 0) {
412 const std::vector<uint8_t>& sizes =
413 traf.auxiliary_size.sample_info_sizes;
414 tri.aux_info_sizes.insert(
415 tri.aux_info_sizes.begin(), sizes.begin() + sample_count_sum,
416 sizes.begin() + sample_count_sum + trun.sample_count);
422 if (tri.aux_info_default_size) {
423 tri.aux_info_total_size =
424 tri.aux_info_default_size * trun.sample_count;
426 tri.aux_info_total_size = 0;
427 for (
size_t k = 0; k < trun.sample_count; k++) {
428 tri.aux_info_total_size += tri.aux_info_sizes[k];
433 tri.samples.resize(trun.sample_count);
434 for (
size_t k = 0; k < trun.sample_count; k++) {
435 PopulateSampleInfo(*trex, traf.header, trun, k, &tri.samples[k]);
436 run_start_dts += tri.samples[k].duration;
438 runs_.push_back(tri);
439 sample_count_sum += trun.sample_count;
441 next_fragment_start_dts_[track_index] = run_start_dts;
444 std::sort(runs_.begin(), runs_.end(), CompareMinTrackRunDataOffset());
445 run_itr_ = runs_.begin();
455void TrackRunIterator::ResetRun() {
458 sample_dts_ = run_itr_->start_dts;
459 sample_offset_ = run_itr_->sample_start_offset;
460 sample_itr_ = run_itr_->samples.begin();
465 sample_dts_ += sample_itr_->duration;
466 sample_offset_ += sample_itr_->size;
474 return is_encrypted() && aux_info_size() > 0 &&
475 run_itr_->sample_encryption_entries.size() == 0;
482 std::vector<SampleEncryptionEntry>& sample_encryption_entries =
483 runs_[run_itr_ - runs_.begin()].sample_encryption_entries;
484 sample_encryption_entries.resize(run_itr_->samples.size());
486 for (
size_t i = 0; i < run_itr_->samples.size(); i++) {
487 int info_size = run_itr_->aux_info_default_size;
489 info_size = run_itr_->aux_info_sizes[i];
492 const bool has_subsamples =
493 info_size > track_encryption().default_per_sample_iv_size;
494 RCHECK(sample_encryption_entries[i].ParseFromBuffer(
495 track_encryption().default_per_sample_iv_size, has_subsamples,
504 return run_itr_ != runs_.end();
508 return IsRunValid() && (sample_itr_ != run_itr_->samples.end());
518 int64_t offset = kInvalidOffset;
521 offset = std::min(offset, sample_offset_);
523 offset = std::min(offset, aux_info_offset());
525 if (run_itr_ != runs_.end()) {
526 std::vector<TrackRunInfo>::const_iterator next_run = run_itr_ + 1;
527 if (next_run != runs_.end()) {
528 offset = std::min(offset, next_run->sample_start_offset);
529 if (next_run->aux_info_total_size)
530 offset = std::min(offset, next_run->aux_info_start_offset);
533 if (offset == kInvalidOffset)
534 return runs_.empty() ? 0 : runs_[0].sample_start_offset;
538uint32_t TrackRunIterator::track_id()
const {
540 return run_itr_->track_id;
543bool TrackRunIterator::is_encrypted()
const {
545 return track_encryption().default_is_protected == 1;
548int64_t TrackRunIterator::aux_info_offset()
const {
549 return run_itr_->aux_info_start_offset;
552int TrackRunIterator::aux_info_size()
const {
553 return run_itr_->aux_info_total_size;
556bool TrackRunIterator::is_audio()
const {
558 return run_itr_->track_type == kAudio;
561bool TrackRunIterator::is_video()
const {
563 return run_itr_->track_type == kVideo;
568 DCHECK(run_itr_->audio_description);
569 return *run_itr_->audio_description;
574 DCHECK(run_itr_->video_description);
575 return *run_itr_->video_description;
578int64_t TrackRunIterator::sample_offset()
const {
580 return sample_offset_;
583int TrackRunIterator::sample_size()
const {
585 return sample_itr_->size;
588int64_t TrackRunIterator::dts()
const {
593int64_t TrackRunIterator::cts()
const {
595 return sample_dts_ + sample_itr_->cts_offset;
598int64_t TrackRunIterator::duration()
const {
600 return sample_itr_->duration;
603bool TrackRunIterator::is_keyframe()
const {
605 return sample_itr_->is_keyframe;
608const TrackEncryption& TrackRunIterator::track_encryption()
const {
616 std::vector<uint8_t> iv;
617 std::vector<SubsampleEntry> subsamples;
619 size_t sample_idx = sample_itr_ - run_itr_->samples.begin();
620 if (sample_idx < run_itr_->sample_encryption_entries.size()) {
622 run_itr_->sample_encryption_entries[sample_idx];
623 DCHECK(is_encrypted());
626 const size_t total_size_of_subsamples =
628 if (total_size_of_subsamples != 0 &&
629 total_size_of_subsamples !=
static_cast<size_t>(sample_size())) {
630 LOG(ERROR) <<
"Incorrect CENC subsample size.";
631 return std::unique_ptr<DecryptConfig>();
634 iv = sample_encryption_entry.initialization_vector;
635 subsamples = sample_encryption_entry.subsamples;
641 if (protection_scheme != FOURCC_cbcs) {
643 <<
"Constant IV should only be used with 'cbcs' protection scheme.";
645 iv = track_encryption().default_constant_iv;
647 LOG(ERROR) <<
"IV cannot be empty.";
648 return std::unique_ptr<DecryptConfig>();
652 track_encryption().default_kid, iv, subsamples, protection_scheme,
653 track_encryption().default_crypt_byte_block,
654 track_encryption().default_skip_byte_block));
657int64_t TrackRunIterator::GetTimestampAdjustment(
const Movie& movie,
660 const uint32_t track_id = track.header.track_id;
661 const auto iter = timestamp_adjustment_map_.find(track_id);
662 if (iter != timestamp_adjustment_map_.end())
665 int64_t timestamp_adjustment = 0;
666 const std::vector<EditListEntry>& edits = track.edit.list.edits;
667 if (!edits.empty()) {
670 if (edit.media_rate_integer != 1) {
671 LOG(INFO) <<
"dwell EditListEntry is ignored.";
675 if (edit.media_time < 0) {
678 const int64_t scaled_time =
679 Rescale(edit.segment_duration, movie.header.timescale,
680 track.media.header.timescale);
681 timestamp_adjustment += scaled_time;
683 timestamp_adjustment -= edit.media_time;
688 if (timestamp_adjustment == 0) {
689 int64_t composition_offset = 0;
690 if (traf && !traf->runs.empty()) {
691 const auto& cts_offsets =
692 traf->runs.front().sample_composition_time_offsets;
693 if (!cts_offsets.empty())
694 composition_offset = cts_offsets.front();
696 CompositionOffsetIterator composition_offset_iter(
697 track.media.information.sample_table.composition_time_to_sample);
698 if (!composition_offset_iter.IsValid()) {
706 composition_offset = composition_offset_iter.sample_offset();
709 int64_t decode_time = 0;
711 decode_time = traf->decode_time.decode_time;
712 if (composition_offset != 0 && decode_time == 0) {
713 LOG(WARNING) <<
"Seeing non-zero composition offset "
714 << composition_offset
715 <<
". An EditList is probably missing.";
716 if (absl::GetFlag(FLAGS_mp4_reset_initial_composition_offset_to_zero)) {
718 <<
"Adjusting timestamps by " << -composition_offset
719 <<
". Please file a bug to "
720 "https://github.com/shaka-project/shaka-packager/issues if you "
721 "do not think it is right or if you are seeing any problems.";
722 timestamp_adjustment = -composition_offset;
727 timestamp_adjustment_map_.insert(
728 std::make_pair(track_id, timestamp_adjustment));
729 return timestamp_adjustment;
All the methods that are virtual are virtual for mocking.
uint32_t GetTotalSizeOfSubsamples() const